Google DeepMind 发布 Gemini 3.7 Flash,主打编码与智能体场景
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,是面向编码和智能体场景的最强工作模型。
推荐理由:官方给出了编码、网页开发与知识工作场景的基准提升和半价定价,读者可据此评估升级价值。
新模型的发布、开源与迭代:大模型厂商的旗舰更新、开源权重放出、性能与价格变化的第一时间记录。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,是面向编码和智能体场景的最强工作模型。
推荐理由:官方给出了编码、网页开发与知识工作场景的基准提升和半价定价,读者可据此评估升级价值。
Google DeepMind 发布大规模多语种手语转文本模型 SL2T,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中实现美国手语(ASL)到英语的听写。模型基于超过 10 万小时、50 多种手语数据训练,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩,并采用姿态关键点而非原始视频以保护隐私。
推荐理由:原文给出了 SL2T 的训练规模、基准成绩和落地入口,读者可据此判断手语 AI 从实验室走向消费产品的实际进展。
Meta 今日发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,专为本地智能体场景设计,采用 Apache 2.0 许可。模型由 2B 视觉编码器和 28B 文本解码器组成,支持图像、视频输入及多模态工具调用,并附带 DFlash 投机解码加速。
推荐理由:原文给出架构细节、基准对比和本地部署路径,读者可据此评估它在端侧智能体场景的适用性。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其气旋预报精度达到 SOTA,平均比此前模型多出一天以上的提前量,相当于气象学约十年的进步。
推荐理由:原文给出了模型精度提升、开源范围和实际应用案例,读者可以据此判断该模型对气象预报领域的具体价值。
Mistral 发布 Shieldstral,一个 3B 开源多模态安全审核模型,在文本安全上匹配最高 7 倍规模的模型,并在多模态审核上达到新 SOTA。它把内容审核建模为策略自适应问答,推理时用自然语言问题定义策略,无需重训即可统一审核文本和图像,返回校准的安全分数。模型以 Apache 2.0 开源,可在单张 16GB NVIDIA GPU 上运行。
推荐理由:原文给出了把内容审核建模为策略自适应问答的思路,读者可以据此判断这种免重训的审核方式是否适合自身场景。
微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。
推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。
Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,支持视频理解、任务编排和多机器人协作,可将动作执行交给任意底层 VLA 模型。
推荐理由:原文给出了新模型的三大能力升级和公开开放入口,读者可据此判断它如何改变机器人任务编排与多机协作的开发方式。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:Gemini Robotics 2 是最先进的视觉-语言-动作模型(VLA)。
推荐理由:原文给出了三款模型的分工和开放入口,读者可据此判断具身智能模型的能力边界与接入方式。
Google DeepMind 发布三款新 Gemini 模型。Gemini 3.6 Flash 相比 3.5 Flash 减少 17% 输出 token 用量。
推荐理由:官方给出三款新模型的定价、token 效率与关键基准提升,读者可据此评估其在智能体工作流中的成本与性能取舍。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调而成的轻量网络安全模型,用于快速发现、验证和修复软件漏洞。
推荐理由:原文给出了轻量安全模型的定位、基准成绩和内部落地效果,读者可据此判断它在漏洞挖掘场景中的实际价值。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,约 1T 参数、支持 1M 上下文,原生接受图像、文本和音频输入,具备智能体能力,并提供 BF16 和 NVFP4 变体。
推荐理由:原文给出了 Inkling 的架构细节、部署配置和基准表现,读者可以据此判断它作为开源多模态模型的定位与可用性。
Mistral AI 发布 Robostral Navigate,一个 8B 参数的具身导航模型,仅用单个 RGB 摄像头即可让机器人自主导航,在 R2R-CE 验证 unseen 上取得 76.6% 成功率,超过使用深度或多摄像头的最佳系统 4.5 个点。模型完全在模拟环境中训练,通过指向式导航和在线强化学习(CISPO)持续改进,可运行于轮式、腿式和飞行机器人。
推荐理由:原文给出了单摄像头导航模型在 R2R-CE 上的成绩和训练方法,读者可据此判断它相对多传感器方案的效率优势。
Mistral 发布 Leanstral 1.5,一款 Apache-2.0 许可、总参数 119B 但仅 6B 激活的开源模型,在 miniF2F 上达到 100%,解决 PutnamBench 587/672 题,并在 FATE-H(87%)和 FATE-X(34%)上取得新 SOTA。
推荐理由:原文给出了基准成绩、成本对比和真实代码库找 bug 的案例,读者可据此判断它在形式化验证上的实用程度。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、调参和特征工程。模型采用交替行列注意力、行压缩和 ICL 混合架构,完全在数亿个合成数据集上训练,在 TabArena 基准上覆盖 38 个分类和 13 个回归数据集。
推荐理由:原文给出了模型架构、训练方式和在 TabArena 上的评测结果,读者可据此判断零样本表格预测的实际能力。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。
推荐理由:原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是最新的音频模型,支持 70 多种语言的近实时语音到语音翻译,能保留说话者的语调、节奏和音高,并连续生成语音而非逐轮等待。
推荐理由:原文给出了新模型的连续语音翻译能力、覆盖语言数和各产品入口,读者可据此判断它如何改变跨语言实时沟通。
Google DeepMind 发布 Gemma 4 12B,这是其首款支持原生音频输入的中型多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。
推荐理由:原文给出了架构变化、内存占用和开放入口,读者可据此判断它能否在本地硬件上跑起多模态智能体工作流。
Mistral 发布旗舰模型 Mistral Medium 3.5,这是一个 128B 稠密模型,拥有 256k 上下文窗口,采用修改版 MIT 许可开放权重,可在最少四张 GPU 上自托管,SWE-Bench Verified 得分 77.6%。
推荐理由:原文给出了新模型的规模、价格和开放权重,读者可以据此判断它是否适合自托管或接入现有编码工作流。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,支持以图像、音频、视频和文本为输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:原文给出了 Omni 系列首个模型的能力范围和开放入口,读者可据此判断它如何把多模态生成带入现有工作流。
Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。
推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。