Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型
Google DeepMind 发布 Gemini 3.5 Live Translate,这是最新的音频模型,支持 70 多种语言的近实时语音到语音翻译,能保留说话者的语调、节奏和音高,并连续生成语音而非逐轮等待。
推荐理由:原文给出了新模型的连续语音翻译能力、覆盖语言数和各产品入口,读者可据此判断它如何改变跨语言实时沟通。
Google DeepMind 发布 Gemini 3.5 Live Translate,这是最新的音频模型,支持 70 多种语言的近实时语音到语音翻译,能保留说话者的语调、节奏和音高,并连续生成语音而非逐轮等待。
推荐理由:原文给出了新模型的连续语音翻译能力、覆盖语言数和各产品入口,读者可据此判断它如何改变跨语言实时沟通。
Google DeepMind 发布 Gemma 4 12B,这是其首款支持原生音频输入的中型多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。
推荐理由:原文给出了架构变化、内存占用和开放入口,读者可据此判断它能否在本地硬件上跑起多模态智能体工作流。
Google DeepMind 宣布启动为期三个月的机器人加速器项目,从欧洲选出 15 家早期机器人初创公司,提供技术指导、AI 工具链及 Gemini 机器人模型支持。入选企业覆盖物流、制造、医疗、气候和导航等领域,包括将机器人焊接参数选择提速 280 倍的 3D-Components、开发脑组织微机器人的 ROBEAUTE 等。项目本周在伦敦启动,旨在推动物理 AI 研究落地为实际应用。
Google DeepMind 发布在塞拉利昂进行的预注册试验结果,显示使用 Guided Learning 的学生数学成绩比对照组提升 +0.258 个标准差,相当于八周内约 1.2 至 1.7 年的典型学习进步。
推荐理由:原文给出了预注册试验的量化结果和交互数据,读者可以据此判断AI辅助教学的实际效果与局限。
伦敦国王学院、复旦大学和艾伦·图灵研究所构建了 SocioHack 基准,包含 72 个模拟社会环境的沙盒,测试 AI 系统能否在保持形式上合规的同时破坏制度意图。在历史类环境中,RL 训练使 LLM 能以 61.25% 的召回率和 90.85% 的精确率重新发现历史上被修补的漏洞策略。
Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索功能,通过多智能体协作和 Sufficient Context Agent 迭代补全缺失信息,相比标准 RAG 在事实性数据集上准确率提升最高 34%,跨语料场景下可正确回答 90.1% 的问题,现以公开预览形式提供。
推荐理由:原文给出了跨语料检索的准确率提升和公开预览入口,读者可据此评估其对企业多源数据查询的价值。
Google Research 在 Nature 发表论文,介绍被动心率监测系统 PHRM,利用手机前置摄像头在面部解锁后拍摄视频,通过深度学习估计心率,MAPE 小于 10%,并估算每日静息心率,MAE 小于 5 bpm,准确度达到可穿戴设备水平。
推荐理由:原文给出了PHRM系统的技术路线、跨肤色准确率数据和公开数据集,读者可据此评估被动心率监测的可行性与局限。
Google Research 在 GitHub 上以 Apache 2.0 协议开源其水文建模框架,该框架基于 PyTorch 和 LSTM 架构,使用 Caravan 数据集训练,可复现 Google Flood Hub 的河流洪水预报能力。新版模型在基准测试中比旧版将可靠预测期延长六天(有水文站流域)和一天(无水文站流域),并已与捷克水文气象研究所合作集成到 Delft-FEWS 平台。
推荐理由:原文给出了模型架构、训练数据和基准提升,读者可据此评估将 AI 洪水预报接入本地工作流的可行性。
Google Research 在 I/O 2026 上发布多项成果,包括面向科学研究的 Gemini for Science 工具套件(含 Computational Discovery、Hypothesis Generation 等)、升级的智能体开发平台 Antigravity 2.0,以及基于 Coral NPU 的 Synaptics Coralboard 开发板。
推荐理由:原文汇总了 Gemini for Science、Antigravity 2.0、Coralboard 等多项发布,读者可借此把握 Google 在科学研究和开发者工具上的整体布局。
Google 研究团队提出一种零信任聚合方案,用于端侧 AI 的隐私保护分析。该方案结合新型格基密码协议与可信执行环境(TEE),支持单次消息提交,无需设备长时间在线,并确保 Google 只能获得匿名聚合结果。Android SafetyCore 将采用该方案评估安全模型效果,同时保证用户内容仅存于设备端。
推荐理由:原文给出了一种结合密码学与TEE的多层防护设计,读者可据此理解零信任聚合如何兼顾效率与隐私。
Google DeepMind 在亚太地区启动首届 Accelerator 计划,主题为“AI for the Planet”。该计划为期三个月,面向初创公司、研究团队和非营利组织,利用前沿 AI 解决自然、气候、农业、能源等领域的问题。入选机构将获得专家指导及 Google AI 专家在整合前沿 AI 和科学 AI 模型方面的支持,活动以新加坡线下训练营拉开序幕。
Google 在 Nature 发表论文介绍其科研工具 ERA,该工具基于 Gemini 编写和优化科学代码,采用树搜索在基因组学、公共卫生、卫星影像、神经科学、时序预测和数学等基准上达到专家级表现。
推荐理由:原文给出了 ERA 在 Nature 的论文、跨学科基准表现以及 Computational Discovery 的开放入口,读者可据此判断它对科研工作流的影响。
生物学家 Omar Abudayyeh 和 Jonathan Gootenberg 借助 Google DeepMind 的 Co-Scientist 加速衰老研究。该工具扫描数万篇论文并提出 20 多个可测试的基因因子,其中部分经实验验证能驱动细胞进入更年轻状态。它还将筛选数据的文献分析时间从最长六个月缩短至几天。
Google DeepMind 宣布将 Genie 世界模型与 Google 街景真实影像结合,推出 Project Genie 的街景锚定能力,用户可选择美国地点并套用风格生成以真实位置为起点的互动世界。该功能即日起逐步向全球符合条件的 Google AI Ultra 200 美元订阅者开放,Project Genie 仍是 Google Labs 的实验性研究原型。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,支持以图像、音频、视频和文本为输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:原文给出了 Omni 系列首个模型的能力范围和开放入口,读者可据此判断它如何把多模态生成带入现有工作流。
Google 推出 Gemini for Science,包含 Hypothesis Generation、Computational Discovery、Literature Insights 三个实验工具,以及集成 30 多个生命科学数据库的 Science Skills,可在 Google Antigravity 上使用。
推荐理由:原文给出了三个实验工具和 Science Skills 的能力构成与开放入口,读者可据此判断这些工具对科研流程的实际作用。
Google 宣布扩展内容透明度与验证工具,将 SynthID 验证能力从 Gemini 应用扩展到 Search 和 Chrome,并新增 C2PA Content Credentials 验证。
推荐理由:原文梳理了内容溯源工具在搜索、Gemini、Chrome 等产品的落地节奏,读者可据此了解验证能力的使用入口。
Google DeepMind 宣布与新加坡政府建立新的国家 AI 合作伙伴关系,聚焦医疗、教育、科研与可持续发展。合作包括探索 AI 共诊、推进传染病研究、开发 Gemma 驱动的视障跑步助手,并向中小学至初院全体教师提供 Gemini for Education。据估算,AI 加速研发有望到 2040 年为新加坡带来额外 33 亿新元(25 亿美元)经济价值。
剑桥大学 Clare Bryant 教授团队利用 Google DeepMind 的 Co-Scientist 工具,寻找病原体跨物种传播时引发人类严重疾病(如败血症)的分子开关。该工具从候选蛋白逐步锁定到具体氨基酸,团队据此构建含氨基酸突变的细胞系进行验证。Bryant 表示,这类工作通常需两到三年实验,如今有望在六个月内完成。
Calico Life Sciences 的 AI/ML 负责人 Matt Onsum 和首席科学家 Katherine Labbé 正使用 Co-Scientist 梳理衰老生物学中分散的研究发现,并将其转化为值得检验的假说。
爱丁堡大学研究员 Filippo Menolascina 用 Co-Scientist 梳理文献并生成新假设,以应对 MASH 肝病中药物组合爆炸的难题。该系统综合肝脏生物学与药理学证据,指出值得关注的机制并筛选出候选联合疗法。在一例验证中,Co-Scientist 将 NLRP3 炎症小体定位为连接炎症与代谢的分子桥梁,该假设已获实验证实,或为靶向双药疗法铺路。
谷歌的 Co-Scientist 正在帮助 MIT 的 Ritu Raman 和波士顿儿童医院的 Ryan Flynn 加速 ALS 研究。该工具将 Raman 的活体神经肌肉组织模型与 Flynn 的细胞表面 RNA 图谱相结合,把数月文献梳理压缩为快速假设生成与排序。两人正借此寻找新型 RNA 机制,探索针对 ALS 的 RNA 药物。
斯坦福大学遗传学家 Gary Peltz 使用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选肝纤维化候选药物,在活体人类肝细胞测试中,Co-Scientist 选出的三种候选药有两种能阻断纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的损伤反应,而 Peltz 自行挑选的两种药物均未见效果。
推荐理由:原文呈现了AI智能体在药物重定位中的具体实验结果,读者可据此评估其在该领域的实际价值。
Google DeepMind 发布文章,介绍其 AI 天气模型 WeatherNext 在 2025 年飓风 Melissa 中帮助美国国家飓风中心(NHC)提前五天以 80% 置信度预测其将以五级强度登陆牙买加,三天前置信度升至接近 100%。
推荐理由:原文展示了 WeatherNext 在飓风预报中的实际应用与验证数据,读者可据此了解 AI 天气模型如何辅助官方预警决策。
Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。
推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科研假设。该系统通过 Hypothesis Generation 工具向个人研究者开放,未来几周开始推出,研究者可在 labs.google/science 注册。合作案例显示其在肝纤维化药物重定位、ALS、细胞衰老等方向取得进展。
推荐理由:原文给出了多智能体系统的架构、开放入口和多个实验室应用案例,读者可以据此判断它如何加速科研假设生成。
Google DeepMind 发布 AlphaEvolve 一周年总结,该 Gemini 驱动的编码智能体已在数学、物理、基因组学、电网优化等领域取得进展,并开始服务商业客户。
推荐理由:原文汇总了 AlphaEvolve 在健康、能源、科研和商业等领域的落地成果,读者可据此评估其跨领域应用价值。
Jack Clark 在 Import AI 455 中认为,基于公开数据,到 2028 年底有 60% 以上概率出现无人参与的 AI 研发,即 AI 系统能自主构建自身继任者。他列举了编码、科学复现、Kaggle 竞赛、内核设计、后训练、对齐研究等领域的进展,指出 AI 已能自动化大部分 AI 工程环节,并讨论了对齐、生产力倍增、资本密集经济等影响。
Google Research 通过开源软件和开放数据集推动科学突破,其工具已赋能全球超过 25 万研究人员和开发者。相关成果包括处理 250 万例全外显子组和全基因组、Open Buildings 含 18 亿建筑检测、HAI-DEF 下载超 480 万次,并与 UCSC 合作将基因变异识别错误率降低 50%。
Google DeepMind 宣布 AI co-clinician 研究计划,探索AI作为护理团队协作成员、在医生临床监督下与患者互动的模式。在98个真实初级保健查询的盲评中,系统在97例中零关键错误,优于两个常用AI系统;在OpenFDA的RxQA开放式药物问答中超越前沿模型。
推荐理由:原文给出了AI co-clinician在证据综合、药物问答和远程医疗模拟中的具体评测结果,读者可据此判断医疗AI当前的能力边界。
Google 发布博客介绍其研究科学家使用 Empirical Research Assistance(ERA)的四种方式。ERA 是 Google 在 9 月发布的预印本中提出的工具,用于帮助科学家生成专家级实证软件。
推荐理由:原文展示了 ERA 在流行病预测、宇宙学、气候监测和神经科学四个领域的实际应用,读者可据此评估 AI 辅助科研工具的落地效果。
Google DeepMind 宣布与韩国科学技术信息通信部(MSIT)建立合作伙伴关系,以支持韩国 AI 战略并加速生命科学、天气与气候等关键领域的科学突破。
Google 宣布在 Google Photos 的 Auto frame 功能中加入三维感知重构图方法,利用 ML 模型理解场景空间布局,并用生成式 AI 从新视角想象照片。该方法分两阶段,先估计 3D 场景和相机参数,再用生成式扩散模型补全渲染产生的空洞,可自动调整相机位姿和焦距,修复广角镜头造成的透视畸变。该功能现已上线,符合条件的含人照片可一键获得自动调整视角的第二版本。
推荐理由:原文解释了三维感知重构图背后的两阶段方法,读者可以据此理解它与传统修图工具的本质区别。
Google DeepMind 发布新论文,提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛,通过异步数据流隔离局部故障,使系统在硬件故障时仍能保持高可用性。实测中,该架构用 2-5 Gbps 带宽在四个美国区域成功训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持混用 TPU v6e 和 TPU v5p 等不同代际硬件。
推荐理由:原文给出了跨数据中心训练的新架构及其在带宽、容错和硬件混用上的实测结果,读者可据此评估分布式训练的新路径。
Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中提炼高层结构化推理记忆的智能体框架,用于测试时自我进化。
推荐理由:原文给出了 ReasoningBank 在 WebArena 和 SWE-Bench-Verified 上的成功率与效率提升数据,读者可据此判断该记忆框架的实际收益。
Google DeepMind 宣布与埃森哲、贝恩、BCG、德勤、麦肯锡五大咨询公司合作,推动前沿 AI 在企业中的规模化应用。合作包含三大支柱:开发行业特定 AI 方案、合作伙伴提前获取 Gemini 等前沿模型访问权、以及高管对接客户 CEO 与董事会。目前仅 25% 的组织已将 AI 大规模投入生产,而 AI 到 2030 年可为全球经济贡献高达 15.7 万亿美元。
Google Research 在 TMLR 发表论文,提出推理优先的合成数据生成框架 Simula,将数据生成分解为全局多样化、局部多样化、复杂化和质量检查四个可控轴,并引入基于推理的评测指标。
推荐理由:原文把合成数据生成重构为机制设计问题,并给出可独立控制的四个轴,读者可据此评估这类方法在生产场景的适用边界。
Google Research 开发 MoGen 模型,用合成神经元形状改进 AI 重建模型 PATHFINDER,将重建误差降低 4.4%,主要来自合并错误率下降。在完整小鼠脑尺度上,这一改进相当于节省 157 人年的手动校对工作量。MoGen 已作为开源模型发布,并训练了斑胸草雀和果蝇神经元版本。
Google DeepMind 发布 Gemini 3.1 Flash TTS,这是最新的文本转语音模型,支持 70 多种语言和原生多说话人对话。模型引入音频标签功能,可通过自然语言指令控制语速、语气和表达方式,在 Artificial Analysis TTS 排行榜上 Elo 得分 1,211。
推荐理由:官方介绍了新模型的音频标签控制能力和多语言覆盖,读者可据此评估它在语音生成应用中的可用性。
Google 发布 Vantage,一个利用生成式 AI 在模拟环境中创建对话、评估未来技能的研究实验,面向高中生和大学生,现已在 Google Labs 开放英文版注册。
推荐理由:原文给出了评估机制和与人类专家评分的一致性数据,读者可据此判断这类模拟环境评估的可靠性。