Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景
Meta 今日发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,专为本地智能体场景设计,采用 Apache 2.0 许可。模型由 2B 视觉编码器和 28B 文本解码器组成,支持图像、视频输入及多模态工具调用,并附带 DFlash 投机解码加速。
推荐理由:原文给出架构细节、基准对比和本地部署路径,读者可据此评估它在端侧智能体场景的适用性。
文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。
Meta 今日发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,专为本地智能体场景设计,采用 Apache 2.0 许可。模型由 2B 视觉编码器和 28B 文本解码器组成,支持图像、视频输入及多模态工具调用,并附带 DFlash 投机解码加速。
推荐理由:原文给出架构细节、基准对比和本地部署路径,读者可据此评估它在端侧智能体场景的适用性。
Mistral 发布 Shieldstral,一个 3B 开源多模态安全审核模型,在文本安全上匹配最高 7 倍规模的模型,并在多模态审核上达到新 SOTA。它把内容审核建模为策略自适应问答,推理时用自然语言问题定义策略,无需重训即可统一审核文本和图像,返回校准的安全分数。模型以 Apache 2.0 开源,可在单张 16GB NVIDIA GPU 上运行。
推荐理由:原文给出了把内容审核建模为策略自适应问答的思路,读者可以据此判断这种免重训的审核方式是否适合自身场景。
Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,支持视频理解、任务编排和多机器人协作,可将动作执行交给任意底层 VLA 模型。
推荐理由:原文给出了新模型的三大能力升级和公开开放入口,读者可据此判断它如何改变机器人任务编排与多机协作的开发方式。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:Gemini Robotics 2 是最先进的视觉-语言-动作模型(VLA)。
推荐理由:原文给出了三款模型的分工和开放入口,读者可据此判断具身智能模型的能力边界与接入方式。
Google Research 发布 SymptomAI 研究,在 n=13,917 的全国随机对照中,让参与者与五种 Gemini Flash 2.0 SymptomAI 智能体交互,并由临床专家盲评其鉴别诊断(DDx)表现。
推荐理由:原文给出了大规模随机对照结果和可穿戴生物信号佐证,读者可据此评估对话式AI症状评估的真实水平。
Google DeepMind 发布三款新 Gemini 模型。Gemini 3.6 Flash 相比 3.5 Flash 减少 17% 输出 token 用量。
推荐理由:官方给出三款新模型的定价、token 效率与关键基准提升,读者可据此评估其在智能体工作流中的成本与性能取舍。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,约 1T 参数、支持 1M 上下文,原生接受图像、文本和音频输入,具备智能体能力,并提供 BF16 和 NVFP4 变体。
推荐理由:原文给出了 Inkling 的架构细节、部署配置和基准表现,读者可以据此判断它作为开源多模态模型的定位与可用性。
Google Research 发布 SensorFM,一个基于超过一万亿分钟、来自五百万名同意参与者的多模态可穿戴数据预训练的大型传感器基础模型。SensorFM 通过自监督重建学习,可跨心血管、代谢、睡眠和心理健康等任务迁移,在 35 项健康任务中 34 项优于特征工程监督基线。模型还结合了智能体课堂自动构建预测头,并能支撑个人健康智能体的端到端应用。
推荐理由:原文给出了一万亿分钟级可穿戴数据训练的通用传感器基础模型,读者可据此判断它能否替代单任务健康模型。
Google DeepMind 发布 Nano Banana 2 Lite 图像模型和 Gemini Omni Flash 视频模型,均已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 开放。
推荐理由:原文给出了两款模型的定位、价格和开放入口,读者可据此判断如何组合它们搭建多媒体工作流。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块分类和逐页逐词置信度分数,支持 170 种语言,可在单容器内自托管部署。API 定价为每 1000 页 4 美元,Batch API 折扣后 2 美元,Document AI 为 5 美元。独立标注者在人类偏好评测中更倾向于 OCR 4,平均胜率 72%,OlmOCRBench 得分 85.20。
推荐理由:原文给出了新模型在结构化输出、多语言覆盖和自托管方面的能力变化,读者可据此判断它如何接入现有文档处理流程。
Google Research 发布两项关于AI辅助用户理解皮肤问题的研究。一项发表于 JAMA Dermatology 的量化研究显示,使用AI工具时参与者命名皮肤状况的准确率约为对照组的三倍(23% vs 8%),但确定下一步医疗行动的能力提升不显著。另一项与斯坦福医疗AI团队合作的真实世界研究显示,使用应用后参与者命名状况的能力提升260%,临床医生认为预测与自身评估一致的比例为86%。
推荐理由:原文给出两项研究的具体数据,读者可据此判断AI辅助皮肤问题识别对用户理解的实际增益与局限。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。
推荐理由:原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是最新的音频模型,支持 70 多种语言的近实时语音到语音翻译,能保留说话者的语调、节奏和音高,并连续生成语音而非逐轮等待。
推荐理由:原文给出了新模型的连续语音翻译能力、覆盖语言数和各产品入口,读者可据此判断它如何改变跨语言实时沟通。
Google DeepMind 发布 Gemma 4 12B,这是其首款支持原生音频输入的中型多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。
推荐理由:原文给出了架构变化、内存占用和开放入口,读者可据此判断它能否在本地硬件上跑起多模态智能体工作流。
Google Research 在 Nature 发表论文,介绍被动心率监测系统 PHRM,利用手机前置摄像头在面部解锁后拍摄视频,通过深度学习估计心率,MAPE 小于 10%,并估算每日静息心率,MAE 小于 5 bpm,准确度达到可穿戴设备水平。
推荐理由:原文给出了PHRM系统的技术路线、跨肤色准确率数据和公开数据集,读者可据此评估被动心率监测的可行性与局限。
Google Research 在 I/O 2026 上发布多项成果,包括面向科学研究的 Gemini for Science 工具套件(含 Computational Discovery、Hypothesis Generation 等)、升级的智能体开发平台 Antigravity 2.0,以及基于 Coral NPU 的 Synaptics Coralboard 开发板。
推荐理由:原文汇总了 Gemini for Science、Antigravity 2.0、Coralboard 等多项发布,读者可借此把握 Google 在科学研究和开发者工具上的整体布局。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,支持以图像、音频、视频和文本为输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:原文给出了 Omni 系列首个模型的能力范围和开放入口,读者可据此判断它如何把多模态生成带入现有工作流。
Google 宣布扩展内容透明度与验证工具,将 SynthID 验证能力从 Gemini 应用扩展到 Search 和 Chrome,并新增 C2PA Content Credentials 验证。
推荐理由:原文梳理了内容溯源工具在搜索、Gemini、Chrome 等产品的落地节奏,读者可据此了解验证能力的使用入口。
Google DeepMind 发布文章,介绍其 AI 天气模型 WeatherNext 在 2025 年飓风 Melissa 中帮助美国国家飓风中心(NHC)提前五天以 80% 置信度预测其将以五级强度登陆牙买加,三天前置信度升至接近 100%。
推荐理由:原文展示了 WeatherNext 在飓风预报中的实际应用与验证数据,读者可据此了解 AI 天气模型如何辅助官方预警决策。
Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。
推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。