跳到正文

#编码

今日 1 条
今天9月29日周二
  1. The Decoder78

    Anthropic 发布 Claude Sonnet 5.5,多项基准接近 Opus 5.5 且单任务成本低至三成

    Anthropic 发布 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最高降低 30%,在多项基准上接近 Opus 5.5。编码能力较前代大幅跃升,Terminal-Bench 4.0 得分从 10.3% 升至 70.6%,CursorBench 4.0 得分 55.5%,仅比 Opus 5.5 低约两分。

    推荐理由:原文给出了 Sonnet 5.5 与 Opus 5.5 及前代的基准对比和定价,读者可据此判断中端模型的实际性价比。

9月28日周一
  1. Simon Willison77

    Simon Willison 年度演讲:2026年AI行业全景回顾

    Simon Willison 在 WeAreDevelopers 大会闭幕演讲中回顾了2026年AI行业的关键趋势。年初 Claude Opus 4.5 和 GPT-5.1 让编码智能体变得可靠,随后 OpenClaw 掀起个人智能体热潮,开源模型如 Qwen 3.8 27B 已能在笔记本上接近前沿水平。

    推荐理由:作者以亲历者视角梳理2026年AI行业关键趋势,从编码智能体成熟到开源模型崛起,适合快速把握一年脉络。

9月27日周日
9月26日周六
9月25日周五
9月24日周四
  1. AWS Machine Learning Blog62

    AWS 教程:用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体

    AWS 发布教程,介绍如何用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体。OpenCode 是 Go 编写的终端原生 AI 编码智能体,支持 75 多个 LLM 提供商,推理在 AWS 账户内安全进行,无按席位费用。

    推荐理由:原文给出了在 Bedrock 上运行 OpenCode 的完整配置方法,读者可以据此搭建多模型编码工作流。

9月23日周三
9月18日周五
9月12日周六
9月11日周五
  1. GitHub Blog · AI & ML43

    GitHub Copilot app 入门:用 diff、终端和浏览器面板审查 AI 代码

    GitHub Copilot app 新增内置 diff、终端和浏览器面板,让用户无需离开应用即可审查、运行并预览智能体对代码的改动。diff 面板以红绿高亮显示增删行,支持接受或评论;终端面板可直接运行项目命令,浏览器面板配合 Pick & Polish 工具可迭代调整界面元素。完成审查后可直接在应用内接受改动并创建 pull request。

9月9日周三
  1. Mistral AI62

    Mistral 用 AI 智能体将 4 万行 Fortran 77 迁移到 C++ 的实践

    Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 物理模拟器迁移到 C++,并总结了可复用的方法。项目先构建数值一致性校验框架,再用 Vibe CLI 生成调用树并派上百个智能体整理文档,最后采用人工把关的规划、编码、测试、审查智能体工作流逐模块迁移。

    推荐理由:原文给出了用智能体迁移遗留代码的完整工作流和三条可复用原则,读者可直接借鉴到同类项目。

9月8日周二
9月6日周日
9月5日周六
  1. GitHub Blog · AI & ML78

    GitHub 推出 Project HydraFusion 研究预览,通过多模型编排实现前沿质量

    GitHub 推出 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型中选择执行计划,以平衡质量、成本与延迟。它支持 Single、Cascade、Critique 三种执行模式,在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点且成本降低 67%。

    推荐理由:原文给出了多模型编排的三种执行模式与基准测试结果,读者可据此判断它在质量与成本之间的取舍。

9月4日周五
  1. GitHub Blog · AI & ML38

    GitHub Copilot app 入门:如何同时运行多个智能体

    GitHub Copilot app 支持在同一项目上并行运行多个 AI 智能体会话,每个会话独立执行任务、互不干扰,并拥有各自的 Git worktree 和上下文,用户可随时切换且无需重新解释。通过 sessions view 可同时跟踪多个任务进度,例如在示例仓库 tailspin-toys 中并行实现 funded sort 功能、可访问性审查和测试运行,从而减少等待和上下文切换时间。

9月3日周四
  1. Google DeepMind82

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber

    Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。

    推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。

8月14日周五
8月10日周一
  1. Hugging Face Blog85

    Meta 发布开源多模态模型 Muse Glimmer-30B,主打本地智能体场景

    Meta 今日发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,专为本地智能体场景设计,采用 Apache 2.0 许可。模型由 2B 视觉编码器和 28B 文本解码器组成,支持图像、视频输入及多模态工具调用,并附带 DFlash 投机解码加速。

    推荐理由:原文给出架构细节、基准对比和本地部署路径,读者可据此评估它在端侧智能体场景的适用性。

8月4日周二
  1. Microsoft Research80

    微软开源 Orchard 智能体训练框架,Orchard-SWE 在 SWE-bench Verified 达 69.7%

    微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。

    推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。

7月21日周二
7月17日周五
7月1日周三
  1. Hugging Face Blog62

    IBM 发布 ScarfBench,用于评测 AI 智能体的企业 Java 框架迁移能力

    IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。

    推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。

5月28日周四
  1. Mistral AI75

    Mistral 将 Le Chat 升级为统一智能体 Vibe,新增 Work Mode 与 Code Mode

    Mistral 宣布 Le Chat 正式更名为 Vibe,成为同时覆盖办公与编码的统一智能体,原对话、设置和订阅计划全部保留。Vibe 提供 Work Mode 处理收件箱、研究、文档起草等多步骤任务,以及 Code Mode 支持远程编码会话,并推出 VS Code 扩展和 CLI 更新。

    推荐理由:原文完整说明了 Le Chat 更名 Vibe 后的双模式能力与订阅方案,读者可据此判断它如何覆盖办公与编码两类工作流。

5月16日周六
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。

3月11日周三
  1. Mistral AI62

    Mistral 用 Vibe 构建自动写 RSpec 测试的智能体

    Mistral 基于开源编码助手 Vibe 构建了一个自主智能体,自动为 Rails 代码库生成或改进 RSpec 测试,并在 CI/CD 中无人干预运行。它通过 AGENTS.md 提供分步执行计划、按文件类型拆分技能文件,并加入 RuboCop 和 SimpleCov 自定义工具强制验证。

    推荐理由:原文给出了用 AGENTS.md、技能文件和自定义工具构建测试智能体的完整方法,读者可直接迁移到自己的项目。

1月28日周三
  1. Mistral AI65

    Mistral 发布终端原生编码智能体 Vibe 2.0,支持自定义子智能体与技能

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型驱动,新增自定义子智能体、多选澄清、斜杠命令技能和统一智能体模式。Vibe 现已在 Le Chat Pro 和 Team 套餐上线,支持按量付费或自带 API key;Devstral 2 转为付费 API 访问,Experiment 套餐仍提供免费额度。

    推荐理由:官方介绍了终端原生编码智能体的新能力和定价变化,读者可据此判断是否迁移或升级使用。

12月9日周二
  1. Mistral AI82

    Mistral AI 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布下一代编码模型 Devstral 2(123B)和 Devstral Small 2(24B),均采用宽松开源许可,Devstral 2 在 SWE-bench Verified 上取得 72.2% 的成绩,并推出原生 CLI 工具 Mistral Vibe 实现端到端代码自动化。

    推荐理由:原文给出了新模型在 SWE-bench Verified 上的得分、与闭源模型的差距以及 API 定价,读者可据此判断开源编码模型的实际水平与成本。

7月30日周三
  1. Mistral AI62

    Mistral 发布 Codestral 25.08 及完整企业编码栈

    Mistral 发布 Codestral 25.08,接受补全提升 30%、保留代码增加 10%、失控生成减少 50%,并推出包含 Devstral、Codestral Embed 和 Mistral Code 插件的完整企业编码栈,支持云端、VPC 或本地部署。Capgemini、Abanca、SNCF 等企业已在生产环境使用该方案。

    推荐理由:原文给出了 Codestral 25.08 的量化提升和完整企业级编码栈的部署方式,读者可据此评估自托管方案的价值。

7月11日周五
6月4日周三
  1. Mistral AI67

    Mistral 发布企业级 AI 编程助手 Mistral Code

    Mistral 发布企业级 AI 编程助手 Mistral Code,整合 Codestral、Devstral 等四款模型与 IDE 插件、本地部署和企业工具,支持微调与私有化部署。产品基于开源项目 Continue 构建,今日开放 JetBrains 和 VSCode 的私有测试,已获 Abanca、SNCF 和 Capgemini 等企业采用。

    推荐理由:原文给出了产品定位、部署方式和客户案例,读者可以据此判断企业级 AI 编程助手市场的竞争格局。

5月28日周三
  1. Mistral AI62

    Mistral 发布首个代码专用嵌入模型 Codestral Embed

    Mistral AI 发布 Codestral Embed,这是其首个专为代码设计的嵌入模型,在真实代码数据的检索场景中表现突出,显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:原文给出了首个代码专用嵌入模型的性能对比、定价和分块建议,读者可据此评估其在代码检索场景的适用性。

5月21日周三
  1. Mistral AI75

    Mistral AI 发布开源编码智能体 Devstral

    Mistral AI 与 All Hands AI 合作推出面向软件工程任务的智能体大模型 Devstral,在 SWE-Bench Verified 上取得 46.8% 的成绩,超过此前开源最优模型 6 个百分点以上,并以 Apache 2.0 协议免费开源。

    推荐理由:原文给出了基准成绩、开源许可和本地部署门槛,读者可据此评估它作为开源编码智能体的实际可用性。