Google 研究提出 AI 视频联合导演框架,实现连贯长视频生成
Google Research 发布 AI 视频联合导演研究,这是一套构建在 Gemini 和 Veo 之上的统一多智能体框架,通过全局优化和世界状态追踪解决长视频生成中的语义漂移与级联失败问题。
Google Research 发布 AI 视频联合导演研究,这是一套构建在 Gemini 和 Veo 之上的统一多智能体框架,通过全局优化和世界状态追踪解决长视频生成中的语义漂移与级联失败问题。
Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,为原生实时对话模型加入近实时视频生成能力,可边听边看边用动态视觉形象说话。该功能支持精确唇形同步、自然表情和流畅轮换,并可在后台异步调用工具的同时保持对话不中断。即日起在 Gemini Enterprise 中可用,支持跨 97 种语言无缝切换,所有输出均带 SynthID 水印。
推荐理由:原文给出了实时视频形象、异步工具调用和 97 语言同步等能力细节,读者可据此判断企业客服等场景的落地方式。
NVIDIA 联合 Google DeepMind、EMBL-EBI 等机构,通过 AlphaFold Database 开放了 2800 多种病毒的蛋白复合物预测 3D 结构,供全球任何科学家使用。
推荐理由:原文给出了数据集规模、开放入口和可复用的推理流程,读者可据此评估它对病毒研究和疫情准备的实际价值。
Google 公布 Private AI Compute 架构更新,新增安全服务端内存层,让 AI 助手在云端获得跨设备持久记忆,同时保持设备端隐私标准。数据被密封在加密存储中,解锁密钥仅存于个人设备,即使 Google 也无法访问;处理时通过端到端加密通道在安全隔离区临时解密,随后立即重新加密。Google 还发布了防篡改的服务器软件公开记录及独立安全审计结果,供社区验证。
推荐理由:原文给出了加密存储与设备端密钥分离的架构细节,读者可据此判断云端持久记忆的隐私边界。
Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,支持用自然语言提示从零创建自定义角色声音、逐行导演表演,并覆盖 100 多种语言。
推荐理由:原文给出了两款新语音模型的能力边界、开放入口和评测排名,读者可据此判断其适用场景。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,旨在为中间一英里配送问题创建现实基准。该工具模拟中段物流中货物在区域配送中心间的批量运输与多车接力,生成隐私保护数据,弥补该领域公开高质量数据的缺失。源代码与文档已发布于 GitHub。
Google Research 发布新研究实验,利用生成式UI(GenUI)让教师创建定制化、交互式的教育模拟,并推出超过30个面向中学STEM学科的英语学习交互示例库。
推荐理由:原文展示了生成式UI在教育场景的应用路径,读者可了解其教学设计和质量保障机制。
Emerald AI、Google 与 NVIDIA 宣布成立 AI 能源管理联盟(AEMA),这是首个推动数据中心根据电网状况动态管理用电的联盟。AEMA 采用技术中立、基于性能的框架,聚焦响应速度、持续时间、可预测性等可衡量服务,并制定穿越、削减和应急响应义务及标准化技术要求。该联盟旨在通过灵活性更高效利用现有电网容量,加速美国 AI 基础设施接入。
Google 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,用离线强化学习将属性对齐的查询扇出编译为监督信号,并蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归推理,无需测试时思维 token。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,解决零样本 LLM 的释义坍缩与自回归延迟瓶颈。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音对话模型,前者面向规模与成本效率,后者面向高复杂度任务。
推荐理由:官方给出了两个新模型的定位差异、基准成绩和开放渠道,读者可据此判断它们适合哪些语音智能体场景。
Google Research 在 ACL 2026 提出 ToolGrad,一种“答案优先”的工具使用数据集生成方法,先生成真实工具调用链再标注用户提示,相比传统 DFS 方法成本更低且能生成更复杂的数据。
Google DeepMind 发布 AlphaGenome Atlas 平台,包含人类基因组中 90 亿个单核苷酸变异的分子效应预测,并推出 AVI 评分用于快速排序变异影响。该平台以 1PB 数据集形式提供,面向学术研究免费开放,可通过网站门户、AlphaGenome API 及 Google Antigravity 技能访问,商业用途即将在 Google Cloud 上线。
推荐理由:原文给出了覆盖全基因组 90 亿单核苷酸变异的预测平台及其开放入口,读者可据此判断它在罕见病和复杂性状研究中的可用范围。
Google Research 发布一项研究,系统评估了多基因风险评分(PRS)在非欧洲人群中的跨人群迁移表现。实验利用 UK Biobank(UKB)欧洲人群与 Biobank Japan(BBJ)近 20 万日本样本,对八种临床性状进行消融分析。
Google Research 与 HHMI Janelia 等合作方在 Cell 发表论文,发布完整雄性果蝇脑与中枢神经系统连接组图谱,含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最大的脑图谱。该图谱经人工校验,可通过开源工具 Neuroglancer 查看和下载,并与雌性果蝇图谱互补,用于研究两性差异及个体间变异性。
推荐理由:原文给出了迄今最大的脑图谱及其开放下载入口,读者可据此了解连接组学方法的最新进展。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为目前最先进、最准确的全球天气模型。
推荐理由:原文给出了分辨率、更新频率和降水精度等关键指标,读者可据此判断新一代天气模型的实际能力提升。
Google DeepMind 今日推出 Fairwind 计划,这是一个面向政府和受信任合作伙伴的有限访问项目,提供其最先进的网络防御能力。该计划首先让防御者使用 Gemini 3.8 Flash Cyber 模型和 CodeMender 工具,自主发现并修复漏洞,在组织安全云环境中几分钟内生成可部署的补丁。
推荐理由:原文给出了 Fairwind 计划的准入对象、能力组合和开放范围,读者可据此判断该计划对自身组织的适用性。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。
Google Research 与 NASA JPL 合作发表 PNAS 论文,提出 MAPL-EMIT 深度学习框架,基于 Swin-S vision transformer 处理 EMIT 高光谱数据,可同时完成甲烷羽流增强量化、羽流分割和源定位。
推荐理由:原文给出了模型架构、训练方法和实测召回率,读者可据此评估这套深度学习方案在甲烷点源监测上的实际能力。
Google DeepMind 推出智能体视频理解功能,覆盖 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite,可将 token 消耗降低最多 88%、成本降低最多 66%,准确率提升最多 7%。
推荐理由:官方给出了 token 与成本降幅和准确率提升的具体数字,读者可据此判断该功能对长视频分析的实际价值。
Google Research 发布 TimesFM-3,这是其时序基础模型家族的新一代版本,原生预训练用于多变量预测,参数量 3.3 亿,在超过 1 万亿时间点的真实与合成语料上完成预训练。
推荐理由:原文给出了模型架构、参数量、评测排名和开放入口,读者可据此判断它相对单变量模型的提升幅度。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练评估的完整地理空间预测流程。
推荐理由:原文展示了 PPE 在公共卫生、粮食安全、疫情预测等任务上的具体提升幅度,读者可据此评估自主地理空间建模的当前能力边界。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成式视频能力。
推荐理由:官方介绍了场景扩展、首尾帧控制、4K 放大等新能力,读者可据此判断它是否适合接入自己的视频生成工作流。
Google DeepMind 推出全球首个针对专有前沿 AI 模型的双盲评测,将外部评测限制在加密环境中,防止模型提前看到测试题。该评测与新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons 合作,用 Gemini Flash Lite 模型在隐私保护环境中测试机密基准,以提升评测完整性。
推荐理由:原文介绍了用加密环境做双盲评测的具体做法,读者可借此理解如何缓解基准污染、提升评测可信度。
Google Research 推出 GlucoFM,一种面向连续血糖监测(CGM)的自监督基础模型,采用双流设计分离缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,GlucoFM 的平均 PR-AUC 比最优 GluFormer 变体高 5.8 个百分点,并在所有糖尿病风险和 β 细胞功能障碍评估中领先。
Google DeepMind 发布 Gemini 3.5 Transcribe,这是其最精确的语音转文字模型,支持实时流式与预录音频处理,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用。
推荐理由:原文给出了新模型的精度、延迟和开放入口,读者可以据此判断它相比 Chirp 3 的实际提升。
Google Research在CHI 2026发布AgentHands研究原型,为XR环境中的AI智能体赋予与语音同步的3D手部手势,将LLM输出映射为实时物理动作。该系统通过手势事件库和词级时间戳实现手势与TTS精确同步,用户研究(N=12)显示其相比纯语音基线在空间接地方面有显著提升。
Google Research 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序构建为迭代研究循环的多智能体系统。
Google DeepMind 宣布与 Fenris Creations 及 EVE Universe 等游戏开发商建立新研究合作,继续以游戏推动 AI 突破。其 SIMA 2 智能体由 Gemini 驱动,能通过屏幕、自然语言指令和键鼠操作实现类人游戏水平,无需 API 或源码访问。此前 DQN、AlphaGo、AlphaZero、AlphaStar 等成果已多次推动强化学习与通用系统发展。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将聚合的匿名移动模式(如到达时间、停留时长)与文本描述结合,为地点构建动态嵌入。该框架在公开基准上使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估计提升 24.7%。ME-POIs 通过空间多尺度传播解决数据稀疏问题,并将移动性从预测任务转为定义地点本身的输入特征。
Google Research 推出 PhotoScan,一个基于深度学习的研究框架,可从标准 2D 智能手机照片估算三维身体成分指标,包括体脂率(BF%)、A/G 比值和 V/S 比值。
推荐理由:原文给出了PhotoScan在体脂率、A/G和V/S比值上的误差数据,以及相比智能手表BIA和DXA的预测能力对比,读者可据此判断智能手机影像估算代谢风险的可行性。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,是面向编码和智能体场景的最强工作模型。
推荐理由:官方给出了编码、网页开发与知识工作场景的基准提升和半价定价,读者可据此评估升级价值。
Google DeepMind 发布大规模多语种手语转文本模型 SL2T,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中实现美国手语(ASL)到英语的听写。模型基于超过 10 万小时、50 多种手语数据训练,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩,并采用姿态关键点而非原始视频以保护隐私。
推荐理由:原文给出了 SL2T 的训练规模、基准成绩和落地入口,读者可据此判断手语 AI 从实验室走向消费产品的实际进展。
Google Research 提出知识画像框架,将事实状态分为编码失败、召回失败等五类,并发布 WikiProfile 基准,含 2,150 条维基百科事实。
推荐理由:论文用知识画像框架区分编码与召回失败,指出前沿模型的事实错误主要来自知识难以访问而非缺失,并验证了思考机制能恢复部分已编码事实。
Google Research 推出 AMIE (Video),基于 Gemini 和 Project Astra 构建,支持实时视频临床问诊,可感知非语言线索并引导虚拟体格检查。
推荐理由:原文呈现了 AMIE (Video) 在实时视频问诊中达到专家级水平的关键结果,读者可据此评估多模态医疗 AI 的当前能力边界。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其气旋预报精度达到 SOTA,平均比此前模型多出一天以上的提前量,相当于气象学约十年的进步。
推荐理由:原文给出了模型精度提升、开源范围和实际应用案例,读者可以据此判断该模型对气象预报领域的具体价值。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以其实例化 Science One Framework 自主科研原型,配套 CoE Audit 审计指标。
推荐理由:原文给出可验证性框架与审计方法,读者可据此判断自主科研智能体输出的可信度如何被量化。
Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,支持视频理解、任务编排和多机器人协作,可将动作执行交给任意底层 VLA 模型。
推荐理由:原文给出了新模型的三大能力升级和公开开放入口,读者可据此判断它如何改变机器人任务编排与多机协作的开发方式。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,今日在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面提升:支持更自然丰富的旋律结构、更高品质的歌词生成、更具表现力和情感的人声,并允许用户更轻松地控制输出节奏和时长。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:Gemini Robotics 2 是最先进的视觉-语言-动作模型(VLA)。
推荐理由:原文给出了三款模型的分工和开放入口,读者可据此判断具身智能模型的能力边界与接入方式。
Google Research 发布 SymptomAI 研究,在 n=13,917 的全国随机对照中,让参与者与五种 Gemini Flash 2.0 SymptomAI 智能体交互,并由临床专家盲评其鉴别诊断(DDx)表现。
推荐理由:原文给出了大规模随机对照结果和可穿戴生物信号佐证,读者可据此评估对话式AI症状评估的真实水平。