跳到正文
原文
Google DeepMind·· 2026-06-11精选AI 评分79

Google DeepMind 发布开源扩散模型 DiffusionGemma,推理速度最高提升 4 倍

DiffusionGemma: 4x faster text generation

AI 导读

Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。

推荐理由

原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。

来源:Google DeepMind · deepmind.google