使用 Amazon Nova Act 实现合成监控
Amazon Nova Act 通过多模态大语言模型处理 UI 截图而非 DOM 选择器,以自然语言指令驱动浏览器工作流,在早期企业用例中对浏览器工作流准确率超过 90%。
Amazon Nova Act 通过多模态大语言模型处理 UI 截图而非 DOM 选择器,以自然语言指令驱动浏览器工作流,在早期企业用例中对浏览器工作流准确率超过 90%。
Hugging Face 发布 Holo4 系列智能体模型,含 27B dense 和 35B-A3B MoE 两个尺寸,均已在 H Models API 上线,并同步开源 Holotron4 Nano。
推荐理由:原文给出了新模型的双尺寸、跨界面能力和开源轨迹数据,读者可据此评估它在真实业务工作流中的性价比。
GPT-6 Astra 完成 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的两倍。其对用户意图更强的理解能力,让 Basis 在实际应用中更有信心。
Proaction 使用 Codex、GPT-Live-1 和 GPT-6 Astra 构建、运营并销售现代车队管理方案,销售额提升 60%,节省 75 多小时。
GitHub Copilot app 的 canvases(画布)功能让用户无需编码即可通过 /create-canvas 技能用自然语言描述需求,生成可共享的看板、发布清单、仪表盘等自定义界面。画布支持双向交互,用户和智能体可同时更新卡片、字段或按钮,且无需单独同步步骤。创建后的画布可保存为扩展供团队或个人复用,社区还通过 Awesome Copilot 分享了现成的画布扩展。
AWS 机器学习博客发布 NarrateAI 系列第二篇,详解在 Amazon Bedrock 上实现生产级 LLM 质量保障的五项技术:自适应流水线编排、跨账户多模型故障转移、实时流式评估、复合评估框架和数据准确性验证。该系统为超过 4,000 名 AWS 高管提供商业智能服务,实测数值准确率约 99%,流式响应约 13 秒开始输出,相比顺序评估延迟降低 86.8%。
GitHub Copilot 官方博客提出聊天并非与 LLM 交互的最佳界面,主张用可自定义的 canvas 全栈应用替代。canvas 能双向与 Copilot 智能体通信,可调用第三方 API 并在本地执行代码,例如构建 Connect 4 游戏、管理 Winget 包或操作 SQLite 数据库。
推荐理由:原文用 GitHub Copilot 的 canvas 实例说明为何聊天不是与 AI 交互的唯一界面,读者可借此判断自定义 UI 对自身工作流的价值。
亚马逊云科技发布参考架构,通过 Amazon Bedrock AgentCore Gateway 和 MCP 构建多账户 AI 智能体,让数据留在各业务账户本地,查询时仅流出所需数据。
Aderant 通过 Amazon Bedrock 使用 Amazon Nova Lite 构建了智能工单分析器,为法律行业业务管理软件的 SierraOps 团队自动化工单分类、路由和知识补充流程。该系统在生产前 2.5 周内审查了 109 个工单,路由准确率约 96%,预计每周节省 8-14 个工程小时,总运营成本低于每月 30 美元,其中 Bedrock 推理成本低于每月 1 美元。
AWS 官方博客发布了一套基于 Strands Agents SDK、Amazon Bedrock、Rekognition 和 Transcribe 的智能体视频问答方案,用户可用自然语言查询视频内容。
AWS 发布教程,介绍如何用 Amazon Bedrock 上的开源权重模型运行 OpenCode 编码智能体。OpenCode 是 Go 编写的终端原生 AI 编码智能体,支持 75 多个 LLM 提供商,推理在 AWS 账户内安全进行,无按席位费用。
推荐理由:原文给出了在 Bedrock 上运行 OpenCode 的完整配置方法,读者可以据此搭建多模型编码工作流。
GPT-6 Astra 能生成结构更清晰、更贴合语境的 legal 文档,让律师得以专注于策略层面。Harvey 将这一模型能力应用于法律实务,提升了草稿质量。
Ringg 借助 OpenAI 的 GPT-5.6,在语音、聊天、WhatsApp 和网页端部署多语言 AI 智能体,能自主解决高达 65% 的客户来电。相比 GPT-4.1,其成本降低 90%。
Airbnb 正扩大对 GPT-6 Astra 及 OpenAI 前沿模型的访问权限,帮助工程团队解决 bug、设计系统并加快交付速度。此举旨在让更多内部团队直接调用这些模型,提升开发效率与产品迭代节奏。
GPT-6 Astra 使 Parallel 的智能体在研究和综合劳动力市场数据时,时间和成本均较此前模型降低一半。该结果来自 Parallel 的实际应用,体现了新模型在数据密集型任务上的效率提升。
NVIDIA 提出 AI 安全本质是工程问题,需在智能体栈的每一层(模型、工具、运行时环境)落实可执行的安全边界、责任人与防护证据。NVIDIA 开源 OpenShell 安全运行时,在智能体触及范围之外强制策略并提供沙箱执行;Cisco DefenseClaw、JFrog 等合作伙伴正基于 OpenShell 构建治理与技能扫描层。
V7 利用 GPT-5.6 将散落的公司文件转化为智能体可用的上下文,以完成复杂且可溯源的工作。该方案使成本降低 78%,同时提升了准确性。
GitHub Podcast 最新一期拆解五大 AI 热论:AI 生成代码仍需人工审查、不会用 AI 未必影响求职、Skills 与 MCP 解决不同问题、RAG 未死、代码库难懂或反映可维护性问题。节目主张用提问代替站队,在真实工作中检验观点。
Cooley 基于 ChatGPT Work 构建了 GO Public,将智能引入 IPO 流程,帮助律师更早发现问题,并将判断力聚焦于最关键环节。
OpenAI 发布 Astra for Law,为法律行业带来前沿智能、定制化律所工作流、连接的法律数据源,以及面向机密客户工作的法律级控制。该产品旨在将前沿 AI 能力深度融入法律实务场景。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练而成,使用近三十年企业 CRM 部署数据的专有合成数据集。
推荐理由:原文给出了 Koa 的构建方式、性能数据和开放时间,读者可以据此判断它对企业 CRM 工作流的影响。
IBM 研究团队在 Hugging Face 博客发布新方法,针对智能体多次执行同一任务结果不一致的问题,提出 Consistency Analyzer 诊断工具和一致性准则。
推荐理由:原文给出了可复现的评测指标和诊断方法,读者可据此衡量自家智能体的稳定性并定位易翻转的决策点。
Fyxer 借助 OpenAI 模型、微调、记忆机制和真实用户反馈,为用户整理收件箱并按个人语气起草邮件。该系统通过持续学习用户偏好,提升回复的个性化与可信度,从而赢得用户对 AI 行政助理的信任。
Perplexity 已采用 GPT-6 Astra 处理通信撰写、软件变更及生产系统监控等端到端任务。相比早期模型,Perplexity 对 Astra 的检查频率大幅降低,表明其对该模型的自主能力信任度显著提升。
GitHub 日韩市场负责人 Tomoko Tanaka 分享如何用 GitHub Copilot 将活动运营自动化:从单个 GitHub Issue 自动搭建落地页、生成 UTM 链接、每日筛选报名者,到会后用 /lead-upload 和 /event-report 两个斜杠命令完成 CRM 上传和报告。
推荐理由:作者用 GitHub Copilot 把活动运营流程自动化,给出了从 Issue 表单到 Skills 的完整可迁移方法。
GPT-6 Astra 提升了 Devin 的软件测试与验证能力,目标是让工程师减少代码审查工作量、加快交付速度。
Google Research 在 ACL 2026 提出 ToolGrad,一种“答案优先”的工具使用数据集生成方法,先生成真实工具调用链再标注用户提示,相比传统 DFS 方法成本更低且能生成更复杂的数据。
César de la Fuente 实验室利用 Codex 和 ChatGPT 在现存及灭绝物种的基因组中搜索抗菌候选分子,以对抗耐药性感染。该方法借助 AI 加速从海量基因数据中识别潜在抗菌肽,为药物研发提供新路径。
OpenAI 在 ChatGPT Work 中推出 Data agent,用户可通过自然语言连接公司数据、挖掘洞察并构建交互式仪表盘。该功能旨在让非技术用户也能直接对业务数据进行分析与可视化,无需编写代码或依赖数据团队。
OpenAI 推出 Agents API,这是一项托管服务,由 Codex harness 提供编排、长时间运行会话和工具使用能力,用于构建和启动云端智能体。
推荐理由:原文给出了 Agents API 的定位与核心能力,读者可据此判断它如何简化云端智能体的构建与部署。
Mistral 帮助一家欧洲能源运营商将 4 万行 Fortran 77 物理模拟器迁移到 C++,并总结了可复用的方法。项目先构建数值一致性校验框架,再用 Vibe CLI 生成调用树并派上百个智能体整理文档,最后采用人工把关的规划、编码、测试、审查智能体工作流逐模块迁移。
推荐理由:原文给出了用智能体迁移遗留代码的完整工作流和三条可复用原则,读者可直接借鉴到同类项目。
OpenAI 推出 GPT-6 Astra,定位其最具商业能力的模型,具备高级推理、计算机使用能力,以及更强的写作与设计判断力。该模型面向工作场景,旨在提升企业级任务的智能化水平。
MIT 研究员借助 GPT-5.6 Sol 与 Codex 自主运行量子计算实验,完成结果分析与量子比特校准。该组合展示了 AI 智能体在科研场景中端到端执行复杂实验流程的能力。
GitHub 推出 Project HydraFusion 研究预览,通过运行时编排在多个提供商的模型中选择执行计划,以平衡质量、成本与延迟。它支持 Single、Cascade、Critique 三种执行模式,在 TerminalBench 2.1 上相比 Claude Opus 5 提升 4.9 个百分点且成本降低 67%。
推荐理由:原文给出了多模型编排的三种执行模式与基准测试结果,读者可据此判断它在质量与成本之间的取舍。
GitHub Copilot app 支持在同一项目上并行运行多个 AI 智能体会话,每个会话独立执行任务、互不干扰,并拥有各自的 Git worktree 和上下文,用户可随时切换且无需重新解释。通过 sessions view 可同时跟踪多个任务进度,例如在示例仓库 tailspin-toys 中并行实现 funded sort 功能、可访问性审查和测试运行,从而减少等待和上下文切换时间。
Legora 借助 GPT-6 Astra 在几分钟内完成 41 份文档的审阅,找出了全部四个预设错误,并在该财务审阅工作流中将性能提升近 40%。
Hugging Face 发布开源工具 funes,为 Claude Code、Codex、pi 和 Hermes 等编码智能体提供本地持久记忆层。它从智能体已有会话日志构建索引,支持 recall 和 get 工具,默认本地运行,也可绑定到私有 Hugging Face 数据集跨机器共享。基准测试显示 recall 比手写交接便宜 8 倍和 4 倍。
推荐理由:原文给出了安装命令、跨智能体记忆机制和基准对比,读者可据此判断它能否解决自己切换智能体时丢失上下文的问题。
Google DeepMind 今日推出 Fairwind 计划,这是一个面向政府和受信任合作伙伴的有限访问项目,提供其最先进的网络防御能力。该计划首先让防御者使用 Gemini 3.8 Flash Cyber 模型和 CodeMender 工具,自主发现并修复漏洞,在组织安全云环境中几分钟内生成可部署的补丁。
推荐理由:原文给出了 Fairwind 计划的准入对象、能力组合和开放范围,读者可据此判断该计划对自身组织的适用性。
Google Research在CHI 2026发布AgentHands研究原型,为XR环境中的AI智能体赋予与语音同步的3D手部手势,将LLM输出映射为实时物理动作。该系统通过手势事件库和词级时间戳实现手势与TTS精确同步,用户研究(N=12)显示其相比纯语音基线在空间接地方面有显著提升。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个尺寸,均基于 Granite-4.1 基座模型后训练而来,采用多阶段强化学习流水线,其中 8B 和 30B 额外经过智能体强化学习,可在真实沙箱环境中调用工具、编辑代码、操作终端和搜索网页。所有模型均支持思考与非思考模式切换、低努力思考模式及原生工具调用,以 Apache 2.0 协议开源。
推荐理由:IBM 官方详解 Granite 4.2 推理模型家族的构建过程,读者可借此了解其多阶段强化学习与智能体训练的具体做法。