跳到正文

Agent 智能体

让模型自主规划、调用工具、完成多步任务的技术方向——从 Claude Code、Manus 到各家 Agent 框架与评测基准的全部动态。

最新精选

第 81–100 条 · 共 112 条
6月25日周四
  1. Google DeepMind78

    Gemini 3.5 Flash 内置计算机使用能力,支持跨平台智能体构建

    Google DeepMind 宣布计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面端看、推理并行动的智能体。

    推荐理由:原文说明了计算机使用能力从独立模型并入主模型后的性能提升与安全机制,读者可据此评估企业自动化场景的适用性。

6月24日周三
  1. Mistral AI62

    Mistral 发布连接器新管理能力,支持多账户与调试器

    Mistral 为 Connectors 推出多项新能力:增强的管理控制(GA)可按工作区或组织设置连接器访问并逐工具开关,带连接器作用域的 API 密钥(GA)防止自动化 AI 工作负载中的身份冒充,多账户连接器(GA)允许一个连接器绑定多个账户。

    推荐理由:原文给出了连接器在权限、身份、调试和 Agent 工作流上的具体能力变化,读者可据此评估企业级接入的落地方式。

6月17日周三
  1. Google DeepMind62

    Google DeepMind 与英国政府合作开发 AI 规划审批原型,目标将审批时间减半

    Google DeepMind 与英国政府合作开发基于 Gemini 的 AI 规划审批原型,目标是将房主规划申请的处理时间缩短 50%。该工具可整合数据、识别当地政策、总结反馈并起草评估报告,规划官员仍保留最终决策权。早期试点在 Barnet、Camden 和 Dorset 进行,政府计划 2027 年起向全国所有议会开放。

    推荐理由:原文给出了原型工具的功能范围和落地时间表,读者可以据此判断 AI 辅助政务审批的实际路径。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap,以系统级安全守护内部智能体

    Google DeepMind 发布 AI Control Roadmap,在传统对齐之外增加系统级安全层,将内部智能体视为潜在未对齐对象,通过威胁建模、监督与分级响应提供保障。团队已分析百万条编码智能体轨迹,并据此为 Gemini Spark 智能体构建实时监控,多数标记事件源于智能体误解而非恶意意图。

    推荐理由:原文给出了威胁建模、分级响应和百万轨迹实测,读者可据此理解系统级安全如何补足对齐的局限。

6月5日周五
  1. Cloudflare Blog · AI Gateway62

    Cloudflare AI Gateway 推出花费上限与身份驱动预算

    Cloudflare 在 AI Gateway 中推出花费上限功能,以美元为单位按模型、提供商或自定义属性设置预算,实时跟踪累计花费,超限默认拦截请求,也可通过 Dynamic Routes 降级到备用模型,现已面向所有套餐开放公测。

    推荐理由:原文给出按美元计费的花费上限与身份归因方案,可了解团队级 AI 成本控制的具体做法。

  2. Google Research62

    Gemini Enterprise Agent Platform 推出 Agentic RAG 跨语料检索功能

    Google 在 Gemini Enterprise Agent Platform 上推出由 Agentic RAG 驱动的跨语料检索功能,通过多智能体协作和 Sufficient Context Agent 迭代补全缺失信息,相比标准 RAG 在事实性数据集上准确率提升最高 34%,跨语料场景下可正确回答 90.1% 的问题,现以公开预览形式提供。

    推荐理由:原文给出了跨语料检索的准确率提升和公开预览入口,读者可据此评估其对企业多源数据查询的价值。

5月29日周五
  1. Google Research62

    Google Research 在 I/O 2026 发布 Gemini for Science 与 Antigravity 2.0 等多项成果

    Google Research 在 I/O 2026 上发布多项成果,包括面向科学研究的 Gemini for Science 工具套件(含 Computational Discovery、Hypothesis Generation 等)、升级的智能体开发平台 Antigravity 2.0,以及基于 Coral NPU 的 Synaptics Coralboard 开发板。

    推荐理由:原文汇总了 Gemini for Science、Antigravity 2.0、Coralboard 等多项发布,读者可借此把握 Google 在科学研究和开发者工具上的整体布局。

5月28日周四
  1. Mistral AI62

    Mistral 发布工业工程 AI 栈并升级 Vibe 智能体

    Mistral 在 AI Now Summit 2026 上发布面向工业工程的集成 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调数据安全。其智能体工具 Vibe 升级为可处理编码、研究等长周期任务的统一智能体,同时宣布在法国 Les Ulis 建设 10 MW 推理数据中心,计划 2026 年 Q3 启用。

    推荐理由:原文给出工业工程 AI 栈、Vibe 智能体升级和法国数据中心三项动作,读者可据此了解 Mistral 面向企业关键流程的布局。

  2. Mistral AI75

    Mistral 将 Le Chat 升级为统一智能体 Vibe,新增 Work Mode 与 Code Mode

    Mistral 宣布 Le Chat 正式更名为 Vibe,成为同时覆盖办公与编码的统一智能体,原对话、设置和订阅计划全部保留。Vibe 提供 Work Mode 处理收件箱、研究、文档起草等多步骤任务,以及 Code Mode 支持远程编码会话,并推出 VS Code 扩展和 CLI 更新。

    推荐理由:原文完整说明了 Le Chat 更名 Vibe 后的双模式能力与订阅方案,读者可据此判断它如何覆盖办公与编码两类工作流。

5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5,并推出云端远程编码智能体

    Mistral 发布旗舰模型 Mistral Medium 3.5,这是一个 128B 稠密模型,拥有 256k 上下文窗口,采用修改版 MIT 许可开放权重,可在最少四张 GPU 上自托管,SWE-Bench Verified 得分 77.6%。

    推荐理由:原文给出了新模型的规模、价格和开放权重,读者可以据此判断它是否适合自托管或接入现有编码工作流。

5月20日周三
  1. Google Research78

    Google 发布科研工具 ERA 并开放 Computational Discovery

    Google 在 Nature 发表论文介绍其科研工具 ERA,该工具基于 Gemini 编写和优化科学代码,采用树搜索在基因组学、公共卫生、卫星影像、神经科学、时序预测和数学等基准上达到专家级表现。

    推荐理由:原文给出了 ERA 在 Nature 的论文、跨学科基准表现以及 Computational Discovery 的开放入口,读者可据此判断它对科研工作流的影响。

5月17日周日
  1. Google DeepMind70

    Google 推出 Gemini for Science 科研工具集与 Science Skills

    Google 推出 Gemini for Science,包含 Hypothesis Generation、Computational Discovery、Literature Insights 三个实验工具,以及集成 30 多个生命科学数据库的 Science Skills,可在 Google Antigravity 上使用。

    推荐理由:原文给出了三个实验工具和 Science Skills 的能力构成与开放入口,读者可据此判断这些工具对科研流程的实际作用。

5月16日周六
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。

5月12日周二
  1. Google DeepMind75

    Google DeepMind 发布 Co-Scientist 多智能体科研助手

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,推出基于 Gemini 的多智能体系统,可迭代生成、辩论和进化科研假设。该系统通过 Hypothesis Generation 工具向个人研究者开放,未来几周开始推出,研究者可在 labs.google/science 注册。合作案例显示其在肝纤维化药物重定位、ALS、细胞衰老等方向取得进展。

    推荐理由:原文给出了多智能体系统的架构、开放入口和多个实验室应用案例,读者可以据此判断它如何加速科研假设生成。

5月6日周三
  1. Google DeepMind80

    AlphaEvolve 发布一周年:Gemini 驱动的编码智能体在多领域展现影响

    Google DeepMind 发布 AlphaEvolve 一周年总结,该 Gemini 驱动的编码智能体已在数学、物理、基因组学、电网优化等领域取得进展,并开始服务商业客户。

    推荐理由:原文汇总了 AlphaEvolve 在健康、能源、科研和商业等领域的落地成果,读者可据此评估其跨领域应用价值。

4月27日周一
  1. Mistral AI73

    Mistral AI 发布 Workflows 编排层公开预览

    Mistral AI 发布 Workflows 编排层公开预览,为 AI 流程提供持久执行、可观测性和人工审批,支持从概念验证到生产环境的可靠运行。Workflows 是 Studio 的一部分,开发者用 Python 编写流程后可发布到 Le Chat 供组织内触发,每一步在 Studio 中可追踪审计。

    推荐理由:原文给出了编排层的核心能力、部署模型和真实客户案例,读者可据此判断它如何把 AI 流程从概念验证推进到生产。

4月22日周三
  1. Google Research60

    Google Research 提出 ReasoningBank 智能体记忆框架,从成功与失败经验中提炼推理模式

    Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中提炼高层结构化推理记忆的智能体框架,用于测试时自我进化。

    推荐理由:原文给出了 ReasoningBank 在 WebArena 和 SWE-Bench-Verified 上的成功率与效率提升数据,读者可据此判断该记忆框架的实际收益。

4月20日周一
  1. Cloudflare Blog · AI Gateway71

    Cloudflare 如何用多智能体编排大规模 AI 代码审查

    Cloudflare 公开其内部 AI 代码审查系统,基于开源编码智能体 OpenCode 构建 CI 原生编排层,由协调智能体调度最多七个专项审查智能体,覆盖安全、性能、代码质量、文档、发布管理和内部合规。

    推荐理由:Cloudflare 公开了内部 AI 代码审查系统的插件架构、模型分层与成本数据,可迁移到自建 CI 审查流程。

4月16日周四
  1. Cloudflare Blog · AI Gateway62

    Cloudflare 推出面向智能体的统一推理层 AI Platform

    Cloudflare 将 AI Gateway 与 Workers AI 整合为统一推理层,用一个 API 接入 12+ 家提供商的 70+ 模型,Workers 用户可用同一 AI.run() 绑定一行代码切换模型,REST API 支持将在未来几周推出。

    推荐理由:原文给出统一推理层的能力边界与接入方式,读者可据此判断多模型智能体架构的落地路径。