Google DeepMind 发布 Gemini Omni Flash 多模态生成模型
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,支持以图像、音频、视频和文本为输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:原文给出了 Omni 系列首个模型的能力范围和开放入口,读者可据此判断它如何把多模态生成带入现有工作流。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,支持以图像、音频、视频和文本为输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:原文给出了 Omni 系列首个模型的能力范围和开放入口,读者可据此判断它如何把多模态生成带入现有工作流。
Google 推出 Gemini for Science,包含 Hypothesis Generation、Computational Discovery、Literature Insights 三个实验工具,以及集成 30 多个生命科学数据库的 Science Skills,可在 Google Antigravity 上使用。
推荐理由:原文给出了三个实验工具和 Science Skills 的能力构成与开放入口,读者可据此判断这些工具对科研流程的实际作用。
Google 宣布扩展内容透明度与验证工具,将 SynthID 验证能力从 Gemini 应用扩展到 Search 和 Chrome,并新增 C2PA Content Credentials 验证。
推荐理由:原文梳理了内容溯源工具在搜索、Gemini、Chrome 等产品的落地节奏,读者可据此了解验证能力的使用入口。
Google DeepMind 宣布与新加坡政府建立新的国家 AI 合作伙伴关系,聚焦医疗、教育、科研与可持续发展。合作包括探索 AI 共诊、推进传染病研究、开发 Gemma 驱动的视障跑步助手,并向中小学至初院全体教师提供 Gemini for Education。据估算,AI 加速研发有望到 2040 年为新加坡带来额外 33 亿新元(25 亿美元)经济价值。
剑桥大学 Clare Bryant 教授团队利用 Google DeepMind 的 Co-Scientist 工具,寻找病原体跨物种传播时引发人类严重疾病(如败血症)的分子开关。该工具从候选蛋白逐步锁定到具体氨基酸,团队据此构建含氨基酸突变的细胞系进行验证。Bryant 表示,这类工作通常需两到三年实验,如今有望在六个月内完成。
Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé 正使用 Co-Scientist 梳理衰老生物学中分散的研究发现,并将其转化为值得检验的假说。
爱丁堡大学研究员 Filippo Menolascina 用 Co-Scientist 梳理文献并生成新假设,以应对 MASH 肝病中药物组合爆炸的难题。该系统综合肝脏生物学与药理学证据,指出值得关注的机制并筛选出候选联合疗法。在一例验证中,Co-Scientist 将 NLRP3 炎症小体定位为连接炎症与代谢的分子桥梁,该假设已获实验证实,或为靶向双药疗法铺路。
谷歌的 Co-Scientist 正在帮助 MIT 的 Ritu Raman 和波士顿儿童医院的 Ryan Flynn 加速 ALS 研究。该工具将 Raman 的活体神经肌肉组织模型与 Flynn 的细胞表面 RNA 图谱相结合,把数月文献梳理压缩为快速假设生成与排序。两人正借此寻找新型 RNA 机制,探索针对 ALS 的 RNA 药物。
斯坦福大学遗传学家 Gary Peltz 使用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选肝纤维化候选药物,在活体人类肝细胞测试中,Co-Scientist 选出的三种候选药有两种能阻断纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的损伤反应,而 Peltz 自行挑选的两种药物均未见效果。
推荐理由:原文呈现了AI智能体在药物重定位中的具体实验结果,读者可据此评估其在该领域的实际价值。
Google DeepMind 发布文章,介绍其 AI 天气模型 WeatherNext 在 2025 年飓风 Melissa 中帮助美国国家飓风中心(NHC)提前五天以 80% 置信度预测其将以五级强度登陆牙买加,三天前置信度升至接近 100%。
推荐理由:原文展示了 WeatherNext 在飓风预报中的实际应用与验证数据,读者可据此了解 AI 天气模型如何辅助官方预警决策。
Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。
推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科研假设。该系统通过 Hypothesis Generation 工具向个人研究者开放,未来几周开始推出,研究者可在 labs.google/science 注册。合作案例显示其在肝纤维化药物重定位、ALS、细胞衰老等方向取得进展。
推荐理由:原文给出了多智能体系统的架构、开放入口和多个实验室应用案例,读者可以据此判断它如何加速科研假设生成。
Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。
推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。
Google DeepMind 发布 AlphaEvolve 一周年总结,该 Gemini 驱动的编码智能体已在数学、物理、基因组学、电网优化等领域取得进展,并开始服务商业客户。
推荐理由:原文汇总了 AlphaEvolve 在健康、能源、科研和商业等领域的落地成果,读者可据此评估其跨领域应用价值。
Google Research 通过开源软件和开放数据集推动科学突破,其工具已赋能全球超过 25 万研究人员和开发者。相关成果包括处理 250 万例全外显子组和全基因组、Open Buildings 含 18 亿建筑检测、HAI-DEF 下载超 480 万次,并与 UCSC 合作将基因变异识别错误率降低 50%。
Google DeepMind 宣布 AI co-clinician 研究计划,探索AI作为护理团队协作成员、在医生临床监督下与患者互动的模式。在98个真实初级保健查询的盲评中,系统在97例中零关键错误,优于两个常用AI系统;在OpenFDA的RxQA开放式药物问答中超越前沿模型。
推荐理由:原文给出了AI co-clinician在证据综合、药物问答和远程医疗模拟中的具体评测结果,读者可据此判断医疗AI当前的能力边界。
Google 发布博客介绍其研究科学家使用 Empirical Research Assistance(ERA)的四种方式。ERA 是 Google 在 9 月发布的预印本中提出的工具,用于帮助科学家生成专家级实证软件。
推荐理由:原文展示了 ERA 在流行病预测、宇宙学、气候监测和神经科学四个领域的实际应用,读者可据此评估 AI 辅助科研工具的落地效果。
Mistral AI 发布 Workflows 编排层公开预览,为 AI 流程提供持久执行、可观测性和人工审批,支持从概念验证到生产环境的可靠运行。Workflows 是 Studio 的一部分,开发者用 Python 编写流程后可发布到 Le Chat 供组织内触发,每一步在 Studio 中可追踪审计。
推荐理由:原文给出了编排层的核心能力、部署模型和真实客户案例,读者可据此判断它如何把 AI 流程从概念验证推进到生产。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作伙伴关系,以支持韩国 AI 战略并加速生命科学、天气与气候等关键领域的科学突破。
Google 宣布在 Google Photos 的 Auto frame 功能中加入三维感知重构图方法,利用 ML 模型理解场景空间布局,并用生成式 AI 从新视角想象照片。该方法分两阶段,先估计 3D 场景和相机参数,再用生成式扩散模型补全渲染产生的空洞,可自动调整相机位姿和焦距,修复广角镜头造成的透视畸变。该功能现已上线,符合条件的含人照片可一键获得自动调整视角的第二版本。
推荐理由:原文解释了三维感知重构图背后的两阶段方法,读者可以据此理解它与传统修图工具的本质区别。
Google DeepMind 发布新论文,提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛,通过异步数据流隔离局部故障,使系统在硬件故障时仍能保持高可用性。实测中,该架构用 2-5 Gbps 带宽在四个美国区域成功训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持混用 TPU v6e 和 TPU v5p 等不同代际硬件。
推荐理由:原文给出了跨数据中心训练的新架构及其在带宽、容错和硬件混用上的实测结果,读者可据此评估分布式训练的新路径。
Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中提炼高层结构化推理记忆的智能体框架,用于测试时自我进化。
推荐理由:原文给出了 ReasoningBank 在 WebArena 和 SWE-Bench-Verified 上的成功率与效率提升数据,读者可据此判断该记忆框架的实际收益。
Google DeepMind 宣布与埃森哲、贝恩、BCG、德勤、麦肯锡五大咨询公司合作,推动前沿 AI 在企业中的规模化应用。合作包含三大支柱:开发行业特定 AI 方案、合作伙伴提前获取 Gemini 等前沿模型访问权、以及高管对接客户 CEO 与董事会。目前仅 25% 的组织已将 AI 大规模投入生产,而 AI 到 2030 年可为全球经济贡献高达 15.7 万亿美元。
GRASP 是一种面向学习型动力学(世界模型)的新型梯度规划器,通过将轨迹提升至虚拟状态实现跨时间并行优化、直接向状态迭代添加随机性以增强探索,并重塑梯度以避免高维视觉模型中的脆弱“状态输入”梯度,使长视野规划变得实用。
Google Research 在 TMLR 发表论文,提出推理优先的合成数据生成框架 Simula,将数据生成分解为全局多样化、局部多样化、复杂化和质量检查四个可控轴,并引入基于推理的评测指标。
推荐理由:原文把合成数据生成重构为机制设计问题,并给出可独立控制的四个轴,读者可据此评估这类方法在生产场景的适用边界。
Google Research 开发 MoGen 模型,用合成神经元形状改进 AI 重建模型 PATHFINDER,将重建误差降低 4.4%,主要来自合并错误率下降。在完整小鼠脑尺度上,这一改进相当于节省 157 人年的手动校对工作量。MoGen 已作为开源模型发布,并训练了斑胸草雀和果蝇神经元版本。
Google DeepMind 发布 Gemini 3.1 Flash TTS,这是最新的文本转语音模型,支持 70 多种语言和原生多说话人对话。模型引入音频标签功能,可通过自然语言指令控制语速、语气和表达方式,在 Artificial Analysis TTS 排行榜上 Elo 得分 1,211。
推荐理由:官方介绍了新模型的音频标签控制能力和多语言覆盖,读者可据此评估它在语音生成应用中的可用性。
Google 发布 Vantage,一个利用生成式 AI 在模拟环境中创建对话、评估未来技能的研究实验,面向高中生和大学生,现已在 Google Labs 开放英文版注册。
推荐理由:原文给出了评估机制和与人类专家评分的一致性数据,读者可据此判断这类模拟环境评估的可靠性。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先模型的重大升级,通过增强空间推理和多视角理解,让机器人更精准地理解环境。
推荐理由:官方介绍了新模型的推理能力升级与仪表读取新功能,读者可据此判断它在机器人任务中的适用边界。
Google Research 推出 ConvApparel,一个包含超 4,000 段人机多轮对话(近 15,000 轮)的服装购物领域数据集,用于量化 LLM 用户模拟器的真实感差距。
Google Research 推出两个智能体框架:PaperVizAgent 用于从学术文本生成出版级图表,ScholarPeer 用于自动化严格评审论文。
Google Research 发布论文《Evaluating alignment of behavioral dispositions in LLMs》,提出一个基于心理学问卷和情境判断测试的框架,评估25个LLM在现实场景中的行为倾向与人类共识的对齐程度。
推荐理由:原文用25个LLM的实测数据展示了模型行为与人类共识之间的两类差距,读者可据此理解当前对齐评估的局限。
Google DeepMind 发布 Gemma 4 开源模型家族,号称迄今最智能的开源模型,专为高级推理和智能体工作流设计,以 Apache 2.0 许可发布。
推荐理由:官方发布稿给出了四个尺寸、上下文窗口和硬件适配细节,读者可据此判断在自有硬件上运行与微调的可行性。
Google Research 发表论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,研究可复现机器学习评测中条目数与每条目评分人数之间的权衡。
推荐理由:原文用真实数据集模拟了标注预算在条目数与每条目评分人数之间的最优分配,读者可据此重新评估自己评测数据的标注策略。
Mistral AI 发布 Spaces CLI,一个面向人类开发者和编码智能体的命令行工具,可用三条命令完成项目脚手架、开发环境启动和部署。其核心设计原则是每个交互输入都有对应的 flag 等价物、每个 flag 都有无头模式下的智能默认值、状态显式化,并通过生成 context.json 和 AGENTS.md 文件帮助智能体理解项目。
推荐理由:Mistral 公开了 Spaces CLI 的完整设计原则,读者可借鉴其让 CLI 同时服务人类与智能体的具体做法。
Google Research 发布白皮书,估算未来量子计算机破解保护加密货币的 256 位椭圆曲线离散对数问题(ECDLP-256)所需的量子资源,发现所需量子比特和门数低于此前认知。
推荐理由:原文给出了量子计算机破解椭圆曲线加密所需资源的最新估算,并说明了零知识证明披露方式,读者可据此评估加密货币迁移到后量子加密的紧迫性。
Google DeepMind 推出由 Gemini 驱动的 AI 指针,让用户通过指向和语音与 AI 交互,无需编写复杂提示词。该功能已集成到 Chrome 中,并将在 Googlebook 笔记本上推出 Magic Pointer,用户可在 Google AI Studio 体验实验版本。
推荐理由:原文给出了AI指针的原理和落地入口,读者可以据此判断这种交互方式会怎样改变日常使用AI的方式。
Google 发布 Vibe Coding XR 工作流,结合 Gemini 的长上下文推理与 XR Blocks 框架,将自然语言直接转化为带物理感知的 Android XR 应用,生成时间在 60 秒内。
推荐理由:原文给出了从自然语言到可运行 XR 应用的完整流程和实测成功率,读者可据此评估该工作流的成熟度与上手成本。
Google Research 推出压缩算法 TurboQuant,通过结合 PolarQuant 与 QJL 技术,在实现高压缩率的同时保持零精度损失,旨在解决向量量化中的内存开销问题,并缓解 KV 缓存瓶颈。
Google Research 推出 S2Vec,一个用于学习建成环境通用嵌入向量的自监督框架。它通过 S2 Geometry 分区和特征栅格化将地理数据转化为多层图像,再用掩码自编码(MAE)学习位置特征,无需人工标注即可预测人口密度、收入等社会经济指标。评测中,S2Vec 在零样本地理泛化任务上表现最佳,与图像嵌入融合后效果更优。