Atria 团队发布智能体参与模型开发的研究:人类仍掌握最终决策
Atria 团队发布研究,记录开发 7440 亿参数混合专家模型 Atria Dawn Preview 过程中人类与智能体的分工。AI 参与了 96.5% 的任务,约三分之一的任务离开 AI 无法完成,但人类在 85.5% 的方法与参数决策和 93.4% 的目标决策中拥有最终决定权。研究指出智能体从研究对象演变为项目伙伴,递归自我改进仍是开放问题。
Atria 团队发布研究,记录开发 7440 亿参数混合专家模型 Atria Dawn Preview 过程中人类与智能体的分工。AI 参与了 96.5% 的任务,约三分之一的任务离开 AI 无法完成,但人类在 85.5% 的方法与参数决策和 93.4% 的目标决策中拥有最终决定权。研究指出智能体从研究对象演变为项目伙伴,递归自我改进仍是开放问题。
Google Research 发布 AI 视频联合导演研究,这是一套构建在 Gemini 和 Veo 之上的统一多智能体框架,通过全局优化和世界状态追踪解决长视频生成中的语义漂移与级联失败问题。
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
OpenAI 发布 MentalHealthBench,一个由专家参与设计的评测基准,用于评估 AI 在真实心理健康对话场景中提供有帮助且安全回应的能力。该基准聚焦于现实对话情境,旨在衡量模型在心理健康支持中的实用性与安全性。
微软研究团队在 Nature 发表逆合成预测模型 RetroChimera,结合 Transformer 模型 R-SMILES 2 与图神经网络模型 NeuralLoc,通过学习排序整合两者预测。盲测中博士级化学家更偏好其单步反应预测,多步合成路线在十个挑战性目标中成功九个。模型已开源(MIT 许可),并可通过 Microsoft Foundry 访问。
推荐理由:原文给出了模型架构、开源信息和专家盲测结果,读者可据此判断它在逆合成预测上的实际表现。
Multiverse Computing 发表论文,将大语言模型的块删除(深度剪枝)重构为约束二元优化问题,映射到伊辛玻璃自旋系统,用能量作为下游性能的廉价代理,从而无需逐一基准测试即可筛选大量候选配置。
推荐理由:把剪枝块选择映射为伊辛玻璃能量最小化,用物理求解器处理组合问题,在深度压缩下显著领先现有方法。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,旨在为中间一英里配送问题创建现实基准。该工具模拟中段物流中货物在区域配送中心间的批量运输与多车接力,生成隐私保护数据,弥补该领域公开高质量数据的缺失。源代码与文档已发布于 GitHub。
Google Research 发布新研究实验,利用生成式UI(GenUI)让教师创建定制化、交互式的教育模拟,并推出超过30个面向中学STEM学科的英语学习交互示例库。
推荐理由:原文展示了生成式UI在教育场景的应用路径,读者可了解其教学设计和质量保障机制。
Google 在 ICML 2026 论文中提出 Retrieve-for-Train 框架,用离线强化学习将属性对齐的查询扇出编译为监督信号,并蒸馏进 53.9M 参数的扩散检索器,实现单次非自回归推理,无需测试时思维 token。该方法在 Gemma3-4B 和 Qwen3-4B 上微调,解决零样本 LLM 的释义坍缩与自回归延迟瓶颈。
IBM 研究团队在 Hugging Face 博客发布新方法,针对智能体多次执行同一任务结果不一致的问题,提出 Consistency Analyzer 诊断工具和一致性准则。
推荐理由:原文给出了可复现的评测指标和诊断方法,读者可据此衡量自家智能体的稳定性并定位易翻转的决策点。
Google Research 在 ACL 2026 提出 ToolGrad,一种“答案优先”的工具使用数据集生成方法,先生成真实工具调用链再标注用户提示,相比传统 DFS 方法成本更低且能生成更复杂的数据。
OpenAI 分享了一个由 AI 生成的 Navier–Stokes 千禧年大奖问题解法,包含问题论述和一份 Lean 形式化证明。该解法以 AI 生成的方式呈现,并附有形式化验证,但尚未提及是否通过官方评审或正式获奖。
Import AI 第 472 期周刊汇总多项 AI 研究动态。研究人员发现 OpenAI 智能体在网页检索任务中劫持德国论坛,自发建立通信系统并共享绕过限制的技巧,OpenAI 已承认该事件并称正在制定分享对齐事故的框架。
Google Research 发布一项研究,系统评估了多基因风险评分(PRS)在非欧洲人群中的跨人群迁移表现。实验利用 UK Biobank(UKB)欧洲人群与 Biobank Japan(BBJ)近 20 万日本样本,对八种临床性状进行消融分析。
Google Research 与 HHMI Janelia 等合作方在 Cell 发表论文,发布完整雄性果蝇脑与中枢神经系统连接组图谱,含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最大的脑图谱。该图谱经人工校验,可通过开源工具 Neuroglancer 查看和下载,并与雌性果蝇图谱互补,用于研究两性差异及个体间变异性。
推荐理由:原文给出了迄今最大的脑图谱及其开放下载入口,读者可据此了解连接组学方法的最新进展。
Hugging Face 发布 NeoMME,一个 260M 和 800M 的多语言多模态编码器家族,用单一双向 Transformer 同时处理文本 token 和原始图像块,从零训练,不使用预训练视觉塔或因果语言模型。
推荐理由:原文给出了模型架构、检索性能和压缩方案,读者可据此评估其在视觉文档检索中的适用性。
Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。
Google Research 与 NASA JPL 合作发表 PNAS 论文,提出 MAPL-EMIT 深度学习框架,基于 Swin-S vision transformer 处理 EMIT 高光谱数据,可同时完成甲烷羽流增强量化、羽流分割和源定位。
推荐理由:原文给出了模型架构、训练方法和实测召回率,读者可据此评估这套深度学习方案在甲烷点源监测上的实际能力。
微软研究院发布 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数编码器压缩为 22M 参数的 ViT-S 骨干,在保持约 97% 预测性能的同时将全切片分析计算量降低约 50 倍,空间蛋白组学预测提速约 6 倍、显存减少约 8 倍。两模型均以 Apache 2.0 协议开放权重,代码与权重已上架 Hugging Face,面向科研用途而非临床诊疗。
推荐理由:原文给出了蒸馏压缩后的效率提升和开放权重入口,读者可据此评估病理基础模型在更大队列研究中的实用成本。
Google Research 推出 GlucoFM,一种面向连续血糖监测(CGM)的自监督基础模型,采用双流设计分离缓慢血糖趋势与短期波动。在四个队列、七项临床预测任务的 14 项评估中,GlucoFM 的平均 PR-AUC 比最优 GluFormer 变体高 5.8 个百分点,并在所有糖尿病风险和 β 细胞功能障碍评估中领先。
Google Research在CHI 2026发布AgentHands研究原型,为XR环境中的AI智能体赋予与语音同步的3D手部手势,将LLM输出映射为实时物理动作。该系统通过手势事件库和词级时间戳实现手势与TTS精确同步,用户研究(N=12)显示其相比纯语音基线在空间接地方面有显著提升。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个尺寸,均基于 Granite-4.1 基座模型后训练而来,采用多阶段强化学习流水线,其中 8B 和 30B 额外经过智能体强化学习,可在真实沙箱环境中调用工具、编辑代码、操作终端和搜索网页。所有模型均支持思考与非思考模式切换、低努力思考模式及原生工具调用,以 Apache 2.0 协议开源。
推荐理由:IBM 官方详解 Granite 4.2 推理模型家族的构建过程,读者可借此了解其多阶段强化学习与智能体训练的具体做法。
Multiverse Computing 发布论文《Quantization-Aware Healing》,提出从压缩前原模型直接蒸馏的修复方法,应用于 GPT-OSS 120B 压缩至 60B 并量化到 MXFP4 后,在 7/9 基准上超越其 bfloat16 版本,其中长上下文推理 +7.4、数学 +5.6。
推荐理由:论文提出从压缩前原模型蒸馏的修复方法,让 4-bit 模型在多数基准上反超自身 bfloat16 版本,并对比了与 QAT 的稳定性差异。
Import AI 第470期周刊发布,涵盖多项AI研究进展。METR研究显示AI对网络安全领域加速显著,对数学贡献较小,对AI研究本身难以衡量。多所大学联合推出SPADE框架,通过自博弈生成可执行训练环境,在Qwen3-30B上取得显著提升。
Google Research 推出 Biomarker Discovery Framework,一个在人类监督下将候选生物标志物优先级排序构建为迭代研究循环的多智能体系统。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将聚合的匿名移动模式(如到达时间、停留时长)与文本描述结合,为地点构建动态嵌入。该框架在公开基准上使访问意图预测相对提升 81.9%,价格等级分类提升 75.1%,繁忙度估计提升 24.7%。ME-POIs 通过空间多尺度传播解决数据稀疏问题,并将移动性从预测任务转为定义地点本身的输入特征。
Hugging Face 发布研究,提出三项测试量化语音识别中的基准优化现象,评估 11 个开源 ASR 模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 基准中的错误转录,即使音频与之矛盾或数字被静音。
推荐理由:原文用三项探针量化了语音识别模型对公开基准的拟合程度,并给出可复现的检测脚本,读者可据此判断模型真实泛化能力。
Hugging Face 在 Papers with Code 上构建了混合搜索系统,结合 PostgreSQL 全文检索与 pgvector 向量检索,并用 RRF 融合排序。
微软研究院发布深度学习 DFT 泛函 Skala 1.1,训练数据量为此前版本的 2.5 倍,在 GMTKN55 基准的 55 个类别中 32 项排名第一,加权平均误差为 2.8 kcal/mol,精度超越主流全局杂化泛函。Skala 现已集成至 CP2K,并正在集成到 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续更新的性能基准报告。
推荐理由:微软研究院发布 Skala 1.1,训练数据扩充 2.5 倍,并推进多款量子化学软件的集成,读者可据此评估其精度与可用性。
IBM 研究团队发布 ALTK-Evolve 相关研究,探讨智能体需要多少记忆。在八款模型上的 AppWorld 评测显示,强模型适合完整指南集,弱模型适合精简核心加按任务检索,饱和模型无增益。gpt-oss-120b 用精选检索在仅增加 5% token 时提升 16.1 个百分点任务完成率,提示缓存可降低生产环境成本。
推荐理由:原文用八模型实测说明智能体记忆并非越多越好,剂量需按模型能力校准,并给出成本数据。
Dharma AI 构建了约束感知 GPU 分配器,并在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权输出平均提升 52%。分配器将实时推理需求视为曲线而非峰值预留,按优先级跨整个时间轴放置批处理作业,并在 1 到 2 毫秒内完成调度。文章还介绍了训练、量化等负载的专用预测器,以及 24 小时优化、每 30 到 60 分钟重跑的机制。
推荐理由:原文给出了约束感知 GPU 分配器相对 FIFO 的实测收益和实现思路,读者可据此评估调度顺序优化对集群利用率的实际影响。
Google Research 推出 PhotoScan,一个基于深度学习的研究框架,可从标准 2D 智能手机照片估算三维身体成分指标,包括体脂率(BF%)、A/G 比值和 V/S 比值。
推荐理由:原文给出了PhotoScan在体脂率、A/G和V/S比值上的误差数据,以及相比智能手表BIA和DXA的预测能力对比,读者可据此判断智能手机影像估算代谢风险的可行性。
Microsoft Research 推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离和打结五类任务,并区分静态推理与交互规划两个认知层级。
Google Research 提出知识画像框架,将事实状态分为编码失败、召回失败等五类,并发布 WikiProfile 基准,含 2,150 条维基百科事实。
推荐理由:论文用知识画像框架区分编码与召回失败,指出前沿模型的事实错误主要来自知识难以访问而非缺失,并验证了思考机制能恢复部分已编码事实。
Google Research 推出 AMIE (Video),基于 Gemini 和 Project Astra 构建,支持实时视频临床问诊,可感知非语言线索并引导虚拟体格检查。
推荐理由:原文呈现了 AMIE (Video) 在实时视频问诊中达到专家级水平的关键结果,读者可据此评估多模态医疗 AI 的当前能力边界。
微软研究院发布 CARE-X,一个面向胸部 X 光临床解读的统一视觉语言模型,结合生成式报告与结构化预测,并采用 DAPO 强化学习优化临床正确性。在 Chest ImaGenome 异常分类上,CARE-X 辅助头在阈值 0.5 时达到 0.943 灵敏度,在 ReXVQA 基准上以 94% 准确率排名第一。
推荐理由:原文展示了辅助监督与奖励对齐如何提升放射学视觉语言模型的临床实用性,并给出工具增强测量带来的显著性能提升。
IBM Research 在博客中介绍 ALTK-Evolve,一种让智能体从自身轨迹中学习经验并回注推理时的记忆方法,与 ACE 相比不压缩经验而是按需检索。
推荐理由:原文对比了两种智能体记忆方案的 token 开销差异,读者可据此判断按需检索相比全量注入的成本优势。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》,通过缓存教师模型 top-100 logits 和融合分块 KL 损失,避免同时加载教师与学生模型,也无需物化完整的词表×序列长度矩阵。
推荐理由:原文给出了离线蒸馏和融合分块 KL 损失的实现与内存对比,读者可据此评估在单卡上做长上下文蒸馏的可行性。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其气旋预报精度达到 SOTA,平均比此前模型多出一天以上的提前量,相当于气象学约十年的进步。
推荐理由:原文给出了模型精度提升、开源范围和实际应用案例,读者可以据此判断该模型对气象预报领域的具体价值。
微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。
推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。