Google Research·· 2026-06-27AI 评分45
Google 用冻结权重的 Multi-Token Prediction 加速 Pixel 上的 Gemini Nano v3
Accelerating Gemini Nano models on Pixel with frozen Multi-Token Prediction
AI 导读
Google 通过为冻结权重的 Gemini Nano v3 模型附加轻量 MTP head,实现端侧推理提速,已部署到 Pixel 9 和 10 系列。该 zero-copy 架构直接复用主模型的 KV cache,每个实例节省 130MB 内存,且因错误草稿会在验证中被丢弃,输出与主模型逐位一致。
来源:Google Research · research.google