Import AI 455:AI 系统即将开始自我构建
Jack Clark 在 Import AI 455 中认为,基于公开数据,到 2028 年底有 60% 以上概率出现无人参与的 AI 研发,即 AI 系统能自主构建自身继任者。他列举了编码、科学复现、Kaggle 竞赛、内核设计、后训练、对齐研究等领域的进展,指出 AI 已能自动化大部分 AI 工程环节,并讨论了对齐、生产力倍增、资本密集经济等影响。
Jack Clark 在 Import AI 455 中认为,基于公开数据,到 2028 年底有 60% 以上概率出现无人参与的 AI 研发,即 AI 系统能自主构建自身继任者。他列举了编码、科学复现、Kaggle 竞赛、内核设计、后训练、对齐研究等领域的进展,指出 AI 已能自动化大部分 AI 工程环节,并讨论了对齐、生产力倍增、资本密集经济等影响。
Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中提炼高层结构化推理记忆的智能体框架,用于测试时自我进化。
推荐理由:原文给出了 ReasoningBank 在 WebArena 和 SWE-Bench-Verified 上的成功率与效率提升数据,读者可据此判断该记忆框架的实际收益。
GRASP 是一种面向学习型动力学(世界模型)的新型梯度规划器,通过将轨迹提升至虚拟状态实现跨时间并行优化、直接向状态迭代添加随机性以增强探索,并重塑梯度以避免高维视觉模型中的脆弱“状态输入”梯度,使长视野规划变得实用。
Google Research 推出压缩算法 TurboQuant,通过结合 PolarQuant 与 QJL 技术,在实现高压缩率的同时保持零精度损失,旨在解决向量量化中的内存开销问题,并缓解 KV 缓存瓶颈。
Mistral 发布 Mistral Small 4,这是首个统一旗舰模型能力的开源模型,融合 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力。
推荐理由:原文给出了架构、性能提升和开放入口,读者可以据此判断它如何统一推理、多模态与编码能力。
Google Research 与康奈尔大学合作发表论文,评估六款大模型回答高温超导领域专家级问题的能力。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 协议开源,并集成进 Mistral Vibe 和免费 API 端点。
推荐理由:原文给出了 Leanstral 的架构、评测分数和成本对比,读者可据此判断它在形式化证明场景中的性价比。
Berkeley AI Research 提出 SPEX 与 ProxySPEX 算法,用于在大规模场景下识别 LLM 中的关键交互。SPEX 利用稀疏性和低阶性将搜索问题转化为稀疏恢复问题,在数千特征规模下保持高忠实度;ProxySPEX 进一步利用层级结构,以约 10 倍更少的消融次数达到与 SPEX 相当的性能。
Mistral 发布下一代模型 Mistral 3,包含 14B、8B、3B 的 Ministral 3 系列和旗舰 Mistral Large 3,全部采用 Apache 2.0 许可证。
推荐理由:原文给出了 Mistral 3 全家族参数、许可证和可用平台,读者可据此判断开源模型的最新能力水位与部署选择。
Seohong Park 在 Berkeley AI Research 博客介绍了一种基于分治范式的新型强化学习算法 Transitive RL(TRL),它不依赖时序差分(TD)学习,而是通过递归拆分轨迹来减少 Bellman 递归次数,从而更好地扩展到长程任务。
推荐理由:原文提出一种不依赖时序差分学习的强化学习新范式,并给出在长程任务上的实验结果,读者可据此评估其可行性。
Mistral AI 发布其首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首次推出推理模型,开源版与商业版并行,读者可据此评估其多语言透明推理能力与部署选择。
Mistral AI 发布 Mistral Medium 3,在多数基准上达到 Claude Sonnet 3.7 的 90% 以上性能,定价为每百万 token 输入 $0.4、输出 $2,成本显著更低。该模型在编码和 STEM 任务上接近更大规模的竞品,并支持混合部署或本地 VPC 部署,API 即日起在 Mistral La Plateforme 和 Amazon Sagemaker 上线。
推荐理由:原文给出了性能对比和定价,读者可以据此判断中等规模模型在成本与能力之间的取舍。