Google 研究提出 AI 视频联合导演框架,实现连贯长视频生成
Google Research 发布 AI 视频联合导演研究,这是一套构建在 Gemini 和 Veo 之上的统一多智能体框架,通过全局优化和世界状态追踪解决长视频生成中的语义漂移与级联失败问题。
Google Research 发布 AI 视频联合导演研究,这是一套构建在 Gemini 和 Veo 之上的统一多智能体框架,通过全局优化和世界状态追踪解决长视频生成中的语义漂移与级联失败问题。
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
微软研究团队在 Nature 发表逆合成预测模型 RetroChimera,结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习排序整合两者预测。盲测中博士级化学家更偏好其单步反应预测,多步合成路线在十个挑战性目标中成功九个。模型已开源(MIT 许可),并可通过 Microsoft Foundry 访问。
推荐理由:原文给出了模型架构、开源信息和专家盲测结果,读者可据此判断它在逆合成预测上的实际表现。
Multiverse Computing 发表论文,将大语言模型的块删除(深度剪枝)重构为约束二元优化问题,映射到伊辛玻璃自旋系统,用能量作为下游性能的廉价代理,从而无需逐一基准测试即可筛选大量候选配置。
推荐理由:把剪枝块选择映射为伊辛玻璃能量最小化,用物理求解器处理组合问题,在深度压缩下显著领先现有方法。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,旨在为中间一英里配送问题创建现实基准。该工具模拟中段物流中货物在区域配送中心间的批量运输与多车接力,生成隐私保护数据,弥补该领域公开高质量数据的缺失。源代码与文档已发布于 GitHub。
Google Research 发布新研究实验,利用生成式UI(GenUI)让教师创建定制化、交互式的教育模拟,并推出超过30个面向中学STEM学科的英语学习交互示例库。
推荐理由:原文展示了生成式UI在教育场景的应用路径,读者可了解其教学设计和质量保障机制。
Google 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,用离线强化学习将属性对齐的查询扇出编译为监督信号,并蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归推理,无需测试时思维 token。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,解决零样本 LLM 的释义坍缩与自回归延迟瓶颈。
IBM 研究团队在 Hugging Face 博客发布新方法,针对智能体多次执行同一任务结果不一致的问题,提出 Consistency Analyzer 诊断工具和一致性准则。
推荐理由:原文给出了可复现的评测指标和诊断方法,读者可据此衡量自家智能体的稳定性并定位易翻转的决策点。
Google Research 在 ACL 2026 提出 ToolGrad,一种“答案优先”的工具使用数据集生成方法,先生成真实工具调用链再标注用户提示,相比传统 DFS 方法成本更低且能生成更复杂的数据。
Google Research 发布一项研究,系统评估了多基因风险评分(PRS)在非欧洲人群中的跨人群迁移表现。实验利用 UK Biobank(UKB)欧洲人群与 Biobank Japan(BBJ)近 20 万日本样本,对八种临床性状进行消融分析。
Google Research 与 HHMI Janelia 等合作方在 Cell 发表论文,发布完整雄性果蝇脑与中枢神经系统连接组图谱,含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最大的脑图谱。该图谱经人工校验,可通过开源工具 Neuroglancer 查看和下载,并与雌性果蝇图谱互补,用于研究两性差异及个体间变异性。
推荐理由:原文给出了迄今最大的脑图谱及其开放下载入口,读者可据此了解连接组学方法的最新进展。
Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。
Google Research 与 NASA JPL 合作发表 PNAS 论文,提出 MAPL-EMIT 深度学习框架,基于 Swin-S vision transformer 处理 EMIT 高光谱数据,可同时完成甲烷羽流增强量化、羽流分割和源定位。
推荐理由:原文给出了模型架构、训练方法和实测召回率,读者可据此评估这套深度学习方案在甲烷点源监测上的实际能力。
Google Earth AI 推出实验性研究能力行星预测引擎(PPE),可自主执行从数据发现到模型训练评估的完整地理空间预测流程。
推荐理由:原文展示了 PPE 在公共卫生、粮食安全、疫情预测等任务上的具体提升幅度,读者可据此评估自主地理空间建模的当前能力边界。
Google Research 推出 GlucoFM,一种面向连续血糖监测(CGM)的自监督基础模型,采用双流设计分离缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,GlucoFM 的平均 PR-AUC 比最优 GluFormer 变体高 5.8 个百分点,并在所有糖尿病风险和 β 细胞功能障碍评估中领先。
Google Research在CHI 2026发布AgentHands研究原型,为XR环境中的AI智能体赋予与语音同步的3D手部手势,将LLM输出映射为实时物理动作。该系统通过手势事件库和词级时间戳实现手势与TTS精确同步,用户研究(N=12)显示其相比纯语音基线在空间接地方面有显著提升。
Multiverse Computing 发布论文《Quantization-Aware Healing》,提出从压缩前原模型直接蒸馏的修复方法,应用于 GPT-OSS 120B 压缩至 60B 并量化到 MXFP4 后,在 7/9 基准上超越其 bfloat16 版本,其中长上下文推理 +7.4、数学 +5.6。
推荐理由:论文提出从压缩前原模型蒸馏的修复方法,让 4-bit 模型在多数基准上反超自身 bfloat16 版本,并对比了与 QAT 的稳定性差异。
Google Research 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序构建为迭代研究循环的多智能体系统。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将聚合的匿名移动模式(如到达时间、停留时长)与文本描述结合,为地点构建动态嵌入。该框架在公开基准上使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估计提升 24.7%。ME-POIs 通过空间多尺度传播解决数据稀疏问题,并将移动性从预测任务转为定义地点本身的输入特征。
Hugging Face 发布研究,提出三项测试量化语音识别中的基准优化现象,评估 11 个开源 ASR 模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 基准中的错误转录,即使音频与之矛盾或数字被静音。
推荐理由:原文用三项探针量化了语音识别模型对公开基准的拟合程度,并给出可复现的检测脚本,读者可据此判断模型真实泛化能力。
IBM 研究团队发布 ALTK-Evolve 相关研究,探讨智能体需要多少记忆。在八款模型上的 AppWorld 评测显示,强模型适合完整指南集,弱模型适合精简核心加按任务检索,饱和模型无增益。gpt-oss-120b 用精选检索在仅增加 5% token 时提升 16.1 个百分点任务完成率,提示缓存可降低生产环境成本。
推荐理由:原文用八模型实测说明智能体记忆并非越多越好,剂量需按模型能力校准,并给出成本数据。
Google Research 推出 PhotoScan,一个基于深度学习的研究框架,可从标准 2D 智能手机照片估算三维身体成分指标,包括体脂率(BF%)、A/G 比值和 V/S 比值。
推荐理由:原文给出了PhotoScan在体脂率、A/G和V/S比值上的误差数据,以及相比智能手表BIA和DXA的预测能力对比,读者可据此判断智能手机影像估算代谢风险的可行性。
Microsoft Research 推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离和打结五类任务,并区分静态推理与交互规划两个认知层级。
Google Research 提出知识画像框架,将事实状态分为编码失败、召回失败等五类,并发布 WikiProfile 基准,含 2,150 条维基百科事实。
推荐理由:论文用知识画像框架区分编码与召回失败,指出前沿模型的事实错误主要来自知识难以访问而非缺失,并验证了思考机制能恢复部分已编码事实。
Google Research 推出 AMIE (Video),基于 Gemini 和 Project Astra 构建,支持实时视频临床问诊,可感知非语言线索并引导虚拟体格检查。
推荐理由:原文呈现了 AMIE (Video) 在实时视频问诊中达到专家级水平的关键结果,读者可据此评估多模态医疗 AI 的当前能力边界。
微软研究院发布 CARE-X,一个面向胸部 X 光临床解读的统一视觉语言模型,结合生成式报告与结构化预测,并采用 DAPO 强化学习优化临床正确性。在 Chest ImaGenome 异常分类上,CARE-X 辅助头在阈值 0.5 时达到 0.943 灵敏度,在 ReXVQA 基准上以 94% 准确率排名第一。
推荐理由:原文展示了辅助监督与奖励对齐如何提升放射学视觉语言模型的临床实用性,并给出工具增强测量带来的显著性能提升。
IBM Research 在博客中介绍 ALTK-Evolve,一种让智能体从自身轨迹中学习经验并回注推理时的记忆方法,与 ACE 相比不压缩经验而是按需检索。
推荐理由:原文对比了两种智能体记忆方案的 token 开销差异,读者可据此判断按需检索相比全量注入的成本优势。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 和融合分块 KL 损失,避免同时加载教师与学生模型,也无需物化完整的词表×序列长度矩阵。
推荐理由:原文给出了离线蒸馏和融合分块 KL 损失的实现与内存对比,读者可据此评估在单卡上做长上下文蒸馏的可行性。
Google Research 提出 Chain-of-Evidence(CoE)可验证性框架,并以其实例化 Science One Framework 自主科研原型,配套 CoE Audit 审计指标。
推荐理由:原文给出可验证性框架与审计方法,读者可据此判断自主科研智能体输出的可信度如何被量化。
微软研究院发布 Echoverse,一套为计算机使用智能体构建的深度演化训练环境,包含十个深度领域世界和两个能力世界。用全部十二个世界训练后,9B 模型得分从 36.5% 提升到 67.1%,接近 GPT-5.4。实验表明浅层环境会拖累模型,深度环境才能迁移;强化学习相对模仿学习能进一步提升留出集表现。微软开源了其中四个世界及其代码、数据和基于数据库的评分器。
推荐理由:原文给出了深度合成环境对计算机使用智能体的训练收益,以及浅层环境反而拖累能力的对比证据,可据此判断训练数据质量与规模哪个更关键。
微软研究院发布 EvoLib 框架,让大语言模型在推理过程中从自身经验中学习,无需真值标签或外部反馈,将过往尝试转化为可复用的技能和反思性洞察。EvoLib 通过整合与动态加权机制持续精炼知识,在数学推理、代码编写和长程决策任务上优于顶级检索式记忆方法,且对任务顺序具有鲁棒性。代码和实验结果已在 GitHub 上公开。
推荐理由:原文给出了将经验转化为可复用知识的具体机制和跨任务评测结果,读者可据此判断这类记忆进化方法相对传统检索记忆的实际收益。
Berkeley AI Research 与 IBM Research 基于 K-Search 框架构建 MLX 后端,通过结构化 CUDA-to-MLX 翻译层,将 NVIDIA 内核优化知识自动迁移到 Apple Silicon。在注意力内核上达到原生 MLX 实现 0.97x 性能,在 Mamba SSM 内核上相比社区 mlx-lm 实现获得最高约 20 倍 prefill 加速。
推荐理由:原文展示了如何把 CUDA 内核优化经验自动迁移到 Apple Silicon,并给出注意力与 Mamba 内核的具体加速数据。
Berkeley AI Research 提出 ABBEL 框架,将递归摘要建模为自然语言信念状态并对其内容进行监督,以提升长程交互中的学习效率。在 CollabBench 协作编码中,基于重建的信念评分将全上下文模型的性能差距缩小约一半,训练步数从 100 减至 50;在 Combination Lock 中,结合领域知识的评分器使学习效率超过全上下文模型。
推荐理由:原文给出了 ABBEL 框架在三个环境上的量化结果,读者可据此判断信念状态监督相比传统递归摘要的实际收益。
Google Research 发布 SymptomAI 研究,在 n=13,917 的全国随机对照中,让参与者与五种 Gemini Flash 2.0 SymptomAI 智能体交互,并由临床专家盲评其鉴别诊断(DDx)表现。
推荐理由:原文给出了大规模随机对照结果和可穿戴生物信号佐证,读者可据此评估对话式AI症状评估的真实水平。
Google Research 在 Nature 发表论文,提出用强化学习框架让自主智能体从量子错误检测中持续学习,动态调控数千个控制参数,在计算过程中稳定量子系统对抗漂移。在 Willow 处理器上,该方法将逻辑稳定性提升 3.5 倍,并在专家校准后进一步将逻辑错误率降低 20%。
推荐理由:原文展示了强化学习如何让量子计算机在运行中持续校准,读者可借此理解机器学习在量子纠错中的新角色。
Google Research 在 ICLR 2026 发表论文,从数学上解释扩散模型的“创造力”并非偶然,而是源于神经网络训练中正则化导致的“分数平滑”效应。该效应使模型在去噪过程中生成训练数据点之间的插值样本,而非简单记忆。研究还发现,即使不显式使用权重衰减,梯度算法带来的隐式正则化也能产生同样效果。
Google Research 发布 SensorFM,一个基于超过一万亿分钟、来自五百万名同意参与者的多模态可穿戴数据预训练的大型传感器基础模型。SensorFM 通过自监督重建学习,可跨心血管、代谢、睡眠和心理健康等任务迁移,在 35 项健康任务中 34 项优于特征工程监督基线。模型还结合了智能体课堂自动构建预测头,并能支撑个人健康智能体的端到端应用。
推荐理由:原文给出了一万亿分钟级可穿戴数据训练的通用传感器基础模型,读者可据此判断它能否替代单任务健康模型。
Google Research 在 Nature Cities 发表研究,通过在 10 个美国城市开展为期六个月的切换实验,仅协调不到 2% 的行程改走相似耗时路线,就使目标路段车速中位数提升约 2%,燃油消耗率中位数下降 0.5% 至 1.0%,并估算每城每年可减少数千吨 CO2e 排放。该研究为从个体路线优化走向全网络协同路由提供了实验框架。
推荐理由:原文给出了首个大规模真实城市路由干预实验的方法与量化结果,读者可据此评估导航平台协调交通的实际收益。
IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。
推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。
Hugging Face 团队提出 DiScoFormer(Density and Score Transformer),单个模型在一次前向传播中即可估计任意数据集的密度与分数,无需针对每个分布重新训练。