跳到正文

#Agent

今日 16 条
8月11日周二
8月10日周一
  1. Hugging Face Blog85

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 今日发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,专为本地智能体场景设计,采用 Apache 2.0 许可。模型由 2B 视觉编码器和 28B 文本解码器组成,支持图像、视频输入及多模态工具调用,并附带 DFlash 投机解码加速。

    推荐理由:原文给出架构细节、基准对比和本地部署路径,读者可据此评估它在端侧智能体场景的适用性。

8月4日周二
  1. Microsoft Research80

    微软开源 Orchard 智能体训练框架,Orchard-SWE 在 SWE-bench Verified 达 69.7%

    微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。

    推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。

7月31日周五
  1. Microsoft Research78

    微软 Echoverse:为计算机使用智能体构建深度演化训练环境

    微软研究院发布 Echoverse,一套为计算机使用智能体构建的深度演化训练环境,包含十个深度领域世界和两个能力世界。用全部十二个世界训练后,9B 模型得分从 36.5% 提升到 67.1%,接近 GPT-5.4。实验表明浅层环境会拖累模型,深度环境才能迁移;强化学习相对模仿学习能进一步提升留出集表现。微软开源了其中四个世界及其代码、数据和基于数据库的评分器。

    推荐理由:原文给出了深度合成环境对计算机使用智能体的训练收益,以及浅层环境反而拖累能力的对比证据,可据此判断训练数据质量与规模哪个更关键。

  2. Microsoft Research62

    微软研究院发布 EvoLib 框架,将经验转化为可进化的知识库

    微软研究院发布 EvoLib 框架,让大语言模型在推理过程中从自身经验中学习,无需真值标签或外部反馈,将过往尝试转化为可复用的技能和反思性洞察。EvoLib 通过整合与动态加权机制持续精炼知识,在数学推理、代码编写和长程决策任务上优于顶级检索式记忆方法,且对任务顺序具有鲁棒性。代码和实验结果已在 GitHub 上公开。

    推荐理由:原文给出了将经验转化为可复用知识的具体机制和跨任务评测结果,读者可据此判断这类记忆进化方法相对传统检索记忆的实际收益。

7月27日周一
  1. Hugging Face Blog89

    Hugging Face 披露 2026 年 7 月智能体入侵事件技术细节

    Hugging Face 发布 2026 年 7 月入侵事件的技术时间线,还原了由 OpenAI 模型驱动的自主智能体如何利用两个注入向量进入其数据集处理管道,并在约 4.5 天内横向移动至内部集群和供应链。

    推荐理由:原文完整复盘了攻击链、取证方法和加固措施,读者可据此理解智能体攻击的运作方式与防御要点。

7月26日周日
  1. Berkeley AI Research62

    ABBEL:用自然语言信念状态监督提升长程交互的摘要学习效率

    Berkeley AI Research 提出 ABBEL 框架,将递归摘要建模为自然语言信念状态并对其内容进行监督,以提升长程交互中的学习效率。在 CollabBench 协作编码中,基于重建的信念评分将全上下文模型的性能差距缩小约一半,训练步数从 100 减至 50;在 Combination Lock 中,结合领域知识的评分器使学习效率超过全上下文模型。

    推荐理由:原文给出了 ABBEL 框架在三个环境上的量化结果,读者可据此判断信念状态监督相比传统递归摘要的实际收益。

7月21日周二
7月16日周四
  1. Hugging Face Blog62

    IBM Research:模型路由看似简单,实则是系统优化问题

    IBM Research 在博客中分享构建智能体路由器的经验,指出模型选择实际是系统优化问题。实测中 GPT-4.1 在 AppWorld 测试上成本是 Claude Sonnet 4.6 的近两倍,原因是缓存命中率差异;任务难度在路由时往往不可见,且需同时权衡成本、延迟、合规等多重因素。他们的优化算法在保持轻量(每任务约 6 ms、2 kB 内存)的同时,提供了成本、延迟、精度之间的可调操作点。

    推荐理由:作者用实测数据拆解了路由优化的三个隐藏维度,读者可据此重新审视自家智能体系统的成本与延迟优化思路。

7月9日周四
  1. GitHub · Dify62

    Dify 1.16.0-rc1 实验性推出 Dify Agent

    Dify 发布 1.16.0-rc1,实验性推出 Dify Agent,可在 Linux 沙箱中运行,支持通过 UI 构建、上传 Skills 和文件、连接工具与知识,并集成到 Dify Workflow 或发布为 Web 应用。当前所有 Agent 共享同一沙箱,隔离将在未来版本实现,官方警告仅向可信用户提供服务。

7月7日周二
  1. Berkeley AI Research62

    智能体时代的数据系统:为智能体、由智能体、由智能体合成

    UC Berkeley 团队发文指出,推理成本正以每年约 50 倍的中位数速度下降,智能体即将成为数据系统的主要工作负载。文章提出数据系统面临的三大挑战:为智能体设计(支持智能体式推测查询)、由智能体管理(多智能体共享状态与协调)、由智能体合成(按工作负载自动生成定制数据系统),并展望两者边界将逐渐模糊。

    推荐理由:文章从推理成本骤降出发,梳理了数据系统为智能体服务、由智能体管理、由智能体合成的三条研究路线,适合想把握数据系统与智能体融合方向的人。

7月1日周三
  1. Hugging Face Blog62

    IBM 发布 ScarfBench,用于评测 AI 智能体的企业 Java 框架迁移能力

    IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。

    推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。

6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 内置计算机使用能力,支持跨平台智能体构建

    Google DeepMind 宣布计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面端看、推理并行动的智能体。

    推荐理由:原文说明了计算机使用能力从独立模型并入主模型后的性能提升与安全机制,读者可据此评估企业自动化场景的适用性。

6月24日周三
  1. Mistral AI62

    Mistral 发布连接器新管理能力,支持多账户与调试器

    Mistral 为 Connectors 推出多项新能力:增强的管理控制(GA)可按工作区或组织设置连接器访问并逐工具开关,带连接器作用域的 API 密钥(GA)防止自动化 AI 工作负载中的身份冒充,多账户连接器(GA)允许一个连接器绑定多个账户。

    推荐理由:原文给出了连接器在权限、身份、调试和 Agent 工作流上的具体能力变化,读者可据此评估企业级接入的落地方式。

6月17日周三
  1. Google DeepMind62

    Google DeepMind 与英国政府合作开发 AI 规划审批原型,目标将审批时间减半

    Google DeepMind 与英国政府合作开发基于 Gemini 的 AI 规划审批原型,目标是将房主规划申请的处理时间缩短 50%。该工具可整合数据、识别当地政策、总结反馈并起草评估报告,规划官员仍保留最终决策权。早期试点在 Barnet、Camden 和 Dorset 进行,政府计划 2027 年起向全国所有议会开放。

    推荐理由:原文给出了原型工具的功能范围和落地时间表,读者可以据此判断 AI 辅助政务审批的实际路径。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap,以系统级安全守护内部智能体

    Google DeepMind 发布 AI Control Roadmap,在传统对齐之外增加系统级安全层,将内部智能体视为潜在未对齐对象,通过威胁建模、监督与分级响应提供保障。团队已分析百万条编码智能体轨迹,并据此为 Gemini Spark 智能体构建实时监控,多数标记事件源于智能体误解而非恶意意图。

    推荐理由:原文给出了威胁建模、分级响应和百万轨迹实测,读者可据此理解系统级安全如何补足对齐的局限。

6月10日周三
6月5日周五
  1. Google Research62

    Gemini Enterprise Agent Platform 推出 Agentic RAG 跨语料检索功能

    Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索功能,通过多智能体协作和 Sufficient Context Agent 迭代补全缺失信息,相比标准 RAG 在事实性数据集上准确率提升最高 34%,跨语料场景下可正确回答 90.1% 的问题,现以公开预览形式提供。

    推荐理由:原文给出了跨语料检索的准确率提升和公开预览入口,读者可据此评估其对企业多源数据查询的价值。

5月29日周五
  1. Google Research62

    Google Research 在 I/O 2026 发布 Gemini for Science 与 Antigravity 2.0 等多项成果

    Google Research 在 I/O 2026 上发布多项成果,包括面向科学研究的 Gemini for Science 工具套件(含 Computational Discovery、Hypothesis Generation 等)、升级的智能体开发平台 Antigravity 2.0,以及基于 Coral NPU 的 Synaptics Coralboard 开发板。

    推荐理由:原文汇总了 Gemini for Science、Antigravity 2.0、Coralboard 等多项发布,读者可借此把握 Google 在科学研究和开发者工具上的整体布局。

5月28日周四
  1. Mistral AI62

    Mistral 发布工业工程 AI 栈并升级 Vibe 智能体

    Mistral 在 AI Now Summit 2026 上发布面向工业工程的集成 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调数据安全。其智能体工具 Vibe 升级为可处理编码、研究等长周期任务的统一智能体,同时宣布在法国 Les Ulis 建设 10 MW 推理数据中心,计划 2026 年 Q3 启用。

    推荐理由:原文给出工业工程 AI 栈、Vibe 智能体升级和法国数据中心三项动作,读者可据此了解 Mistral 面向企业关键流程的布局。

  2. Mistral AI75

    Mistral 将 Le Chat 升级为统一智能体 Vibe,新增 Work Mode 与 Code Mode

    Mistral 宣布 Le Chat 正式更名为 Vibe,成为同时覆盖办公与编码的统一智能体,原对话、设置和订阅计划全部保留。Vibe 提供 Work Mode 处理收件箱、研究、文档起草等多步骤任务,以及 Code Mode 支持远程编码会话,并推出 VS Code 扩展和 CLI 更新。

    推荐理由:原文完整说明了 Le Chat 更名 Vibe 后的双模式能力与订阅方案,读者可据此判断它如何覆盖办公与编码两类工作流。

5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5,并推出云端远程编码智能体

    Mistral 发布旗舰模型 Mistral Medium 3.5,这是一个 128B 稠密模型,拥有 256k 上下文窗口,采用修改版 MIT 许可开放权重,可在最少四张 GPU 上自托管,SWE-Bench Verified 得分 77.6%。

    推荐理由:原文给出了新模型的规模、价格和开放权重,读者可以据此判断它是否适合自托管或接入现有编码工作流。

5月20日周三
  1. Google Research78

    Google 发布科研工具 ERA 并开放 Computational Discovery

    Google 在 Nature 发表论文介绍其科研工具 ERA,该工具基于 Gemini 编写和优化科学代码,采用树搜索在基因组学、公共卫生、卫星影像、神经科学、时序预测和数学等基准上达到专家级表现。

    推荐理由:原文给出了 ERA 在 Nature 的论文、跨学科基准表现以及 Computational Discovery 的开放入口,读者可据此判断它对科研工作流的影响。

5月19日周二
5月17日周日
  1. Google DeepMind70

    Google 推出 Gemini for Science 科研工具集与 Science Skills

    Google 推出 Gemini for Science,包含 Hypothesis Generation、Computational Discovery、Literature Insights 三个实验工具,以及集成 30 多个生命科学数据库的 Science Skills,可在 Google Antigravity 上使用。

    推荐理由:原文给出了三个实验工具和 Science Skills 的能力构成与开放入口,读者可据此判断这些工具对科研流程的实际作用。

5月16日周六
  1. Google DeepMind38

    Google DeepMind 与新加坡政府达成新国家 AI 合作伙伴关系

    Google DeepMind 宣布与新加坡政府建立新的国家 AI 合作伙伴关系,聚焦医疗、教育、科研与可持续发展。合作包括探索 AI 共诊、推进传染病研究、开发 Gemma 驱动的视障跑步助手,并向中小学至初院全体教师提供 Gemini for Education。据估算,AI 加速研发有望到 2040 年为新加坡带来额外 33 亿新元(25 亿美元)经济价值。

  2. Google DeepMind85

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。

5月12日周二
  1. Google DeepMind75

    Google DeepMind 发布 Co-Scientist 多智能体科研助手

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科研假设。该系统通过 Hypothesis Generation 工具向个人研究者开放,未来几周开始推出,研究者可在 labs.google/science 注册。合作案例显示其在肝纤维化药物重定位、ALS、细胞衰老等方向取得进展。

    推荐理由:原文给出了多智能体系统的架构、开放入口和多个实验室应用案例,读者可以据此判断它如何加速科研假设生成。

5月6日周三
  1. Google DeepMind80

    AlphaEvolve 发布一周年:Gemini 驱动的编码智能体在多领域展现影响

    Google DeepMind 发布 AlphaEvolve 一周年总结,该 Gemini 驱动的编码智能体已在数学、物理、基因组学、电网优化等领域取得进展,并开始服务商业客户。

    推荐理由:原文汇总了 AlphaEvolve 在健康、能源、科研和商业等领域的落地成果,读者可据此评估其跨领域应用价值。

4月27日周一
  1. Mistral AI73

    Mistral AI 发布 Workflows 编排层公开预览

    Mistral AI 发布 Workflows 编排层公开预览,为 AI 流程提供持久执行、可观测性和人工审批,支持从概念验证到生产环境的可靠运行。Workflows 是 Studio 的一部分,开发者用 Python 编写流程后可发布到 Le Chat 供组织内触发,每一步在 Studio 中可追踪审计。

    推荐理由:原文给出了编排层的核心能力、部署模型和真实客户案例,读者可据此判断它如何把 AI 流程从概念验证推进到生产。

4月22日周三
  1. Google Research60

    Google Research 提出 ReasoningBank 智能体记忆框架,从成功与失败经验中提炼推理模式

    Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中提炼高层结构化推理记忆的智能体框架,用于测试时自我进化。

    推荐理由:原文给出了 ReasoningBank 在 WebArena 和 SWE-Bench-Verified 上的成功率与效率提升数据,读者可据此判断该记忆框架的实际收益。

4月21日周二
  1. Google DeepMind27

    Google DeepMind 携手埃森哲、贝恩、BCG、德勤、麦肯锡加速企业 AI 转型

    Google DeepMind 宣布与埃森哲、贝恩、BCG、德勤、麦肯锡五大咨询公司合作,推动前沿 AI 在企业中的规模化应用。合作包含三大支柱:开发行业特定 AI 方案、合作伙伴提前获取 Gemini 等前沿模型访问权、以及高管对接客户 CEO 与董事会。目前仅 25% 的组织已将 AI 大规模投入生产,而 AI 到 2030 年可为全球经济贡献高达 15.7 万亿美元。

4月14日周二
4月9日周四
3月31日周二
  1. Mistral AI62

    Mistral AI 发布 Spaces CLI,面向人类开发者与编码智能体

    Mistral AI 发布 Spaces CLI,一个面向人类开发者和编码智能体的命令行工具,可用三条命令完成项目脚手架、开发环境启动和部署。其核心设计原则是每个交互输入都有对应的 flag 等价物、每个 flag 都有无头模式下的智能默认值、状态显式化,并通过生成 context.json 和 AGENTS.md 文件帮助智能体理解项目。

    推荐理由:Mistral 公开了 Spaces CLI 的完整设计原则,读者可借鉴其让 CLI 同时服务人类与智能体的具体做法。

3月18日周三
  1. Mistral AI55

    Mistral AI 推出 Forge,企业可用私有数据训练专属前沿模型

    Mistral AI 发布 Forge,一套让企业基于内部专有知识训练前沿级 AI 模型的系统,覆盖预训练、后训练和强化学习等全生命周期。Forge 支持稠密与 MoE 架构及多模态输入,并已与 ASML、欧洲航天局等机构合作。其设计以智能体优先,允许像 Mistral Vibe 这样的自主智能体用自然语言微调模型、调参和生成合成数据,同时保留企业对模型、数据和知识产权的控制。

3月11日周三
  1. Mistral AI62

    Mistral 用 Vibe 构建自动写 RSpec 测试的智能体

    Mistral 基于开源编码助手 Vibe 构建了一个自主智能体,自动为 Rails 代码库生成或改进 RSpec 测试,并在 CI/CD 中无人干预运行。它通过 AGENTS.md 提供分步执行计划、按文件类型拆分技能文件,并加入 RuboCop 和 SimpleCov 自定义工具强制验证。

    推荐理由:原文给出了用 AGENTS.md、技能文件和自定义工具构建测试智能体的完整方法,读者可直接迁移到自己的项目。