跳到正文
原文
Google Research·· 2026-06-27精选AI 评分60

Google Research 用冻结多 token 预测加速 Pixel 上的 Gemini Nano 模型

Accelerating Gemini Nano models on Pixel with frozen Multi-Token Prediction

AI 导读

Google Research 宣布一种新架构,将多 token 预测(MTP)头附加到冻结的 Gemini Nano v3 模型上,以加速 Pixel 9 和 10 系列上的端侧推理。相比独立草稿模型,MTP 在 Pixel 9 上带来 50% 或以上的速度提升,并节省约 130MB 内存,同时保持输出与主模型逐位一致。该方案已用于 AI 通知摘要和校对等功能,减少能耗并提升电池续航。

推荐理由

原文给出冻结骨干加 MTP 头的端侧加速方案,读者可据此判断其相对独立草稿模型的效率优势。

来源:Google Research · research.google