Google DeepMind 发布 Nano Banana 2 Lite 与 Gemini Omni Flash
Google DeepMind 发布 Nano Banana 2 Lite 图像模型和 Gemini Omni Flash 视频模型,均已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 开放。
推荐理由:原文给出了两款模型的定位、价格和开放入口,读者可据此判断如何组合它们搭建多媒体工作流。
Google DeepMind 发布 Nano Banana 2 Lite 图像模型和 Gemini Omni Flash 视频模型,均已在 Google AI Studio、Gemini API 和 Gemini Enterprise Agent Platform 开放。
推荐理由:原文给出了两款模型的定位、价格和开放入口,读者可据此判断如何组合它们搭建多媒体工作流。
一篇解读 Goldfeder、Wyder、LeCun 和 Shwartz-Ziv 2026 年论文《AI Must Embrace Specialization via Superhuman Adaptable Intelligence》的文章。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、调参和特征工程。模型采用交替行列注意力、行压缩和 ICL 混合架构,完全在数亿个合成数据集上训练,在 TabArena 基准上覆盖 38 个分类和 13 个回归数据集。
推荐理由:原文给出了模型架构、训练方式和在 TabArena 上的评测结果,读者可据此判断零样本表格预测的实际能力。
Every Eval Ever (EEE) 与 Hugging Face Community Evals 实现互通,支持评测结果跨平台发布与解读,并链接到开放模型、排行榜和统一元数据存储。
推荐理由:原文说明了 EEE 与 Hugging Face Community Evals 打通后的双向流程,读者可据此判断评测结果跨平台复用的实际路径。
Hugging Face 团队提出 DiScoFormer(Density and Score Transformer),单个模型在一次前向传播中即可估计任意数据集的密度与分数,无需针对每个分布重新训练。
Google Research 宣布一种新架构,将多 token 预测(MTP)头附加到冻结的 Gemini Nano v3 模型上,以加速 Pixel 9 和 10 系列上的端侧推理。相比独立草稿模型,MTP 在 Pixel 9 上带来 50% 或以上的速度提升,并节省约 130MB 内存,同时保持输出与主模型逐位一致。该方案已用于 AI 通知摘要和校对等功能,减少能耗并提升电池续航。
推荐理由:原文给出冻结骨干加 MTP 头的端侧加速方案,读者可据此判断其相对独立草稿模型的效率优势。
Google 在 CIDR 论文中提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,用轻量级机器学习动态调整缓存大小,以最小化缓存总拥有成本。集成到 Spanner 生产环境后,内存使用减少 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,且 I/O 成本影响仅 0.5%。该方法将驱逐策略与“租赁时长”分离,通过浅层决策树预测 TTL,并已在公开缓存轨迹上验证。
Google Research 在 COLM 2026 发表的论文中,通过受控实验证明允许模型生成推理轨迹能解锁原本无法获取的正确事实答案。研究识别出计算缓冲和事实启动两种互补机制,并发现推理轨迹中若含单个幻觉中间事实会显著降低最终答案正确率。基于此,研究提出在测试时优先保留无幻觉事实的推理轨迹可提升准确率,并建议训练时用过程奖励鼓励事实支持的中间步骤。
推荐理由:原文用受控实验拆解了推理为何能解锁参数化知识,并给出可落地的训练优化方向。
Google DeepMind 宣布计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面端看、推理并行动的智能体。
推荐理由:原文说明了计算机使用能力从独立模型并入主模型后的性能提升与安全机制,读者可据此评估企业自动化场景的适用性。
Mistral 为 Connectors 推出多项新能力:增强的管理控制(GA)可按工作区或组织设置连接器访问并逐工具开关,带连接器作用域的 API 密钥(GA)防止自动化 AI 工作负载中的身份冒充,多账户连接器(GA)允许一个连接器绑定多个账户。
推荐理由:原文给出了连接器在权限、身份、调试和 Agent 工作流上的具体能力变化,读者可据此评估企业级接入的落地方式。
Mistral 发布 OCR 4,在提取文本之外新增边界框、块分类和逐页逐词置信度分数,支持 170 种语言,可在单容器内自托管部署。API 定价为每 1000 页 4 美元,Batch API 折扣后 2 美元,Document AI 为 5 美元。独立标注者在人类偏好评测中更倾向于 OCR 4,平均胜率 72%,OlmOCRBench 得分 85.20。
推荐理由:原文给出了新模型在结构化输出、多语言覆盖和自托管方面的能力变化,读者可据此判断它如何接入现有文档处理流程。
Google DeepMind 与英国政府合作开发基于 Gemini 的 AI 规划审批原型,目标是将房主规划申请的处理时间缩短 50%。该工具可整合数据、识别当地政策、总结反馈并起草评估报告,规划官员仍保留最终决策权。早期试点在 Barnet、Camden 和 Dorset 进行,政府计划 2027 年起向全国所有议会开放。
推荐理由:原文给出了原型工具的功能范围和落地时间表,读者可以据此判断 AI 辅助政务审批的实际路径。
Google Research 发布向量化数据集,将英格兰的树篱、石墙和小林地等细粒度生态特征从像素地图转化为可操作的清单,供土地所有者与保护机构测量和扩展这些特征。该数据集基于预训练于 3 亿张卫星图像的 ViT 模型微调,并用 Polsby-Popper 紧致度评分对几何形状分类,通过 Google Earth Engine 并行处理覆盖超 13 万平方公里的区域。
Google DeepMind 发布 AI Control Roadmap,在传统对齐之外增加系统级安全层,将内部智能体视为潜在未对齐对象,通过威胁建模、监督与分级响应提供保障。团队已分析百万条编码智能体轨迹,并据此为 Gemini Spark 智能体构建实时监控,多数标记事件源于智能体误解而非恶意意图。
推荐理由:原文给出了威胁建模、分级响应和百万轨迹实测,读者可据此理解系统级安全如何补足对齐的局限。
Google Research 发布两项关于AI辅助用户理解皮肤问题的研究。一项发表于 JAMA Dermatology 的量化研究显示,使用AI工具时参与者命名皮肤状况的准确率约为对照组的三倍(23% vs 8%),但确定下一步医疗行动的能力提升不显著。另一项与斯坦福医疗AI团队合作的真实世界研究显示,使用应用后参与者命名状况的能力提升260%,临床医生认为预测与自身评估一致的比例为86%。
推荐理由:原文给出两项研究的具体数据,读者可据此判断AI辅助皮肤问题识别对用户理解的实际增益与局限。
加州大学圣迭戈分校在 Google 支持下,计划将退役 Pixel 手机的主板提取并组成集群,部署一个由 2000 部手机组成的数据中心,为数百名研究人员和学生提供低成本、低碳的云计算服务。早期实验显示,20 部手机组成的集群即可支持 75 人以上班级的峰值提交,延迟低于 AWS 默认后端;该系统预计于 2026 年秋季上线。
推荐理由:原文给出了旧手机集群的计算能力对比和部署计划,读者可以据此评估这种低碳算力方案的可行性。
Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于更灵敏、灵活、准确地审计机器学习模型的“遗忘”效果。该框架通过相对距离测试和自适应超参数选择,理论上可控制任意样本量下的假阳性,并随样本增加将假阴性风险收敛至零。实验涵盖合成基准与高能物理数据集 Expo1D 异常检测任务。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。
推荐理由:原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。
Google DeepMind 联合 Schmidt Sciences、Cooperative AI Foundation、ARIA 等机构,发起最高 1000 万美元的技术研究资助,面向全球研究者征集多智能体 AI 安全提案。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是最新的音频模型,支持 70 多种语言的近实时语音到语音翻译,能保留说话者的语调、节奏和音高,并连续生成语音而非逐轮等待。
推荐理由:原文给出了新模型的连续语音翻译能力、覆盖语言数和各产品入口,读者可据此判断它如何改变跨语言实时沟通。
Google DeepMind 发布 Gemma 4 12B,这是其首款支持原生音频输入的中型多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。
推荐理由:原文给出了架构变化、内存占用和开放入口,读者可据此判断它能否在本地硬件上跑起多模态智能体工作流。
Google DeepMind 宣布启动为期三个月的机器人加速器项目,从欧洲选出 15 家早期机器人初创公司,提供技术指导、AI 工具链及 Gemini 机器人模型支持。入选企业覆盖物流、制造、医疗、气候和导航等领域,包括将机器人焊接参数选择提速 280 倍的 3D-Components、开发脑组织微机器人的 ROBEAUTE 等。项目本周在伦敦启动,旨在推动物理 AI 研究落地为实际应用。
Google DeepMind 发布在塞拉利昂进行的预注册试验结果,显示使用 Guided Learning 的学生数学成绩比对照组提升 +0.258 个标准差,相当于八周内约 1.2 至 1.7 年的典型学习进步。
推荐理由:原文给出了预注册试验的量化结果和交互数据,读者可以据此判断AI辅助教学的实际效果与局限。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索功能,通过多智能体协作和 Sufficient Context Agent 迭代补全缺失信息,相比标准 RAG 在事实性数据集上准确率提升最高 34%,跨语料场景下可正确回答 90.1% 的问题,现以公开预览形式提供。
推荐理由:原文给出了跨语料检索的准确率提升和公开预览入口,读者可据此评估其对企业多源数据查询的价值。
Google Research 在 Nature 发表论文,介绍被动心率监测系统 PHRM,利用手机前置摄像头在面部解锁后拍摄视频,通过深度学习估计心率,MAPE 小于 10%,并估算每日静息心率,MAE 小于 5 bpm,准确度达到可穿戴设备水平。
推荐理由:原文给出了PHRM系统的技术路线、跨肤色准确率数据和公开数据集,读者可据此评估被动心率监测的可行性与局限。
Google Research 在 GitHub 上以 Apache 2.0 协议开源其水文建模框架,该框架基于 PyTorch 和 LSTM 架构,使用 Caravan 数据集训练,可复现 Google Flood Hub 的河流洪水预报能力。新版模型在基准测试中比旧版将可靠预测期延长六天(有水文站流域)和一天(无水文站流域),并已与捷克水文气象研究所合作集成到 Delft-FEWS 平台。
推荐理由:原文给出了模型架构、训练数据和基准提升,读者可据此评估将 AI 洪水预报接入本地工作流的可行性。
Google Research 在 I/O 2026 上发布多项成果,包括面向科学研究的 Gemini for Science 工具套件(含 Computational Discovery、Hypothesis Generation 等)、升级的智能体开发平台 Antigravity 2.0,以及基于 Coral NPU 的 Synaptics Coralboard 开发板。
推荐理由:原文汇总了 Gemini for Science、Antigravity 2.0、Coralboard 等多项发布,读者可借此把握 Google 在科学研究和开发者工具上的整体布局。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的集成 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调数据安全。其智能体工具 Vibe 升级为可处理编码、研究等长周期任务的统一智能体,同时宣布在法国 Les Ulis 建设 10 MW 推理数据中心,计划 2026 年 Q3 启用。
推荐理由:原文给出工业工程 AI 栈、Vibe 智能体升级和法国数据中心三项动作,读者可据此了解 Mistral 面向企业关键流程的布局。
Mistral 宣布 Le Chat 正式更名为 Vibe,成为同时覆盖办公与编码的统一智能体,原对话、设置和订阅计划全部保留。Vibe 提供 Work Mode 处理收件箱、研究、文档起草等多步骤任务,以及 Code Mode 支持远程编码会话,并推出 VS Code 扩展和 CLI 更新。
推荐理由:原文完整说明了 Le Chat 更名 Vibe 后的双模式能力与订阅方案,读者可据此判断它如何覆盖办公与编码两类工作流。
Mistral AI 发布 Search Toolkit 公开预览版,这是一个用于构建 AI 应用生产级搜索管线的可组合开源框架,将数据摄取、检索和评估统一到单一接口中。框架内置 BM25 稀疏检索、稠密向量检索及混合配置,并提供 recall、precision、MRR、NDCG 等评估指标,支持通过 MCP 连接器拉取 CRM、代码仓库等实时数据,已用于 CMA CGM 的假新闻检测场景。
推荐理由:原文给出了框架的组成模块和开放入口,读者可以据此判断它能否简化自家检索管线的搭建。
Google 研究团队提出一种零信任聚合方案,用于端侧 AI 的隐私保护分析。该方案结合新型格基密码协议与可信执行环境(TEE),支持单次消息提交,无需设备长时间在线,并确保 Google 只能获得匿名聚合结果。Android SafetyCore 将采用该方案评估安全模型效果,同时保证用户内容仅存于设备端。
推荐理由:原文给出了一种结合密码学与TEE的多层防护设计,读者可据此理解零信任聚合如何兼顾效率与隐私。
Mistral 宣布推出物理 AI,将 Emmi AI 纳入其企业解决方案,用于 AI 原生工业工程。物理 AI 从求解器输出中学习,在单张 GPU 上数秒内完成正向预测,适用于航空航天、汽车、半导体、能源等领域,并与 ASML、Airbus、Safran、Siemens Energy 等伙伴合作。传统求解器仍用于验证和边缘情况。
推荐理由:原文解释了物理 AI 与传统求解器的分工,以及它在产品设计、制造和数字孪生上的加速价值,可据此判断其适用场景。
Mistral 收购 Emmi AI,专注为航空航天、汽车、半导体和能源等行业构建基础物理 AI。相关成果包括用于跨声速 3D 机翼 CFD 模拟的约 30,000 个样本数据集、AB-UPT 模型(单 GPU 可处理 9M 表面和 140M 体积单元),以及 NeuralDEM 等实时工业过程仿真工具。
Mistral AI 宣布达成最终协议,收购 Physics AI 公司 Emmi AI,以强化其在工业企业的 AI 转型伙伴地位。Emmi AI 总部位于奥地利,专注于大型工程模型,其 30 多名研究人员和工程师将于 5 月加入 Mistral AI 的科学与应用 AI 团队。
推荐理由:原文给出了收购双方的能力互补和团队去向,读者可据此判断工业AI赛道的最新整合方向。
Mistral 发布旗舰模型 Mistral Medium 3.5,这是一个 128B 稠密模型,拥有 256k 上下文窗口,采用修改版 MIT 许可开放权重,可在最少四张 GPU 上自托管,SWE-Bench Verified 得分 77.6%。
推荐理由:原文给出了新模型的规模、价格和开放权重,读者可以据此判断它是否适合自托管或接入现有编码工作流。
Mistral AI 在 Studio 发布 Connectors,所有内置连接器及自定义 MCP 现可通过 API/SDK 用于所有模型和 Agent 调用,并引入直接工具调用与人工审批流程。
推荐理由:原文给出了 Connectors 的开放入口和关键能力,读者可据此判断它如何简化企业级 Agent 的集成与治理。
Google DeepMind 在亚太地区启动首届 Accelerator 计划,主题为“AI for the Planet”。该计划为期三个月,面向初创公司、研究团队和非营利组织,利用前沿 AI 解决自然、气候、农业、能源等领域的问题。入选机构将获得专家指导及 Google AI 专家在整合前沿 AI 和科学 AI 模型方面的支持,活动以新加坡线下训练营拉开序幕。
Google 在 Nature 发表论文介绍其科研工具 ERA,该工具基于 Gemini 编写和优化科学代码,采用树搜索在基因组学、公共卫生、卫星影像、神经科学、时序预测和数学等基准上达到专家级表现。
推荐理由:原文给出了 ERA 在 Nature 的论文、跨学科基准表现以及 Computational Discovery 的开放入口,读者可据此判断它对科研工作流的影响。
生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 借助 Google DeepMind 的 Co-Scientist 加速衰老研究。该工具扫描数万篇论文并提出 20 多个可测试的基因因子,其中部分经实验验证能驱动细胞进入更年轻状态。它还将筛选数据的文献分析时间从最长六个月缩短至几天。
Google DeepMind 宣布将 Genie 世界模型与 Google 街景真实影像结合,推出 Project Genie 的街景锚定能力,用户可选择美国地点并套用风格生成以真实位置为起点的互动世界。该功能即日起逐步向全球符合条件的 Google AI Ultra 200 美元订阅者开放,Project Genie 仍是 Google Labs 的实验性研究原型。