Grok 4.7 上线 Amazon Bedrock,支持 500K 上下文与四级推理强度
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
xAI 的 Grok 4.7 现已上线 Amazon Bedrock,提供 500K token 上下文窗口,支持 low、medium、high、xhigh 四级推理强度,可通过 Responses、Chat Completions 和 Converse API 调用。
推荐理由:原文给出了模型能力、接入方式和成本控制要点,读者可据此判断如何在 Bedrock 上使用 Grok 4.7。
Anthropic 今日发布 Claude Sonnet 5.5,官方称其运行速度快 30% 以上,多数任务成本降低最多 30%,定价与 Sonnet 5 相同但基准测试全面胜出。该模型已用于 claude.ai 免费层,作者实测其生成 3D 鹈鹕骑自行车页面表现扎实,并指出其编码能力接近 Opus 5.5。Haiku 5.5 预计数周内推出。
AWS 宣布 Claude Sonnet 5.5 在 Amazon Bedrock 和 Claude Platform on AWS 上可用。该模型面向聚焦编码和知识工作,多数任务成本更低、速度更快,能完成功能或缺陷修复并对照需求检查结果,生成的文档和图表也更精致。
推荐理由:原文给出了 Sonnet 5.5 的能力提升、适用场景和接入方式,读者可据此判断它适合哪些编码与知识工作负载。
Anthropic 发布 Claude Sonnet 5.5,输出速度提升超 30%,单任务成本最高降低 30%,在多项基准上接近 Opus 5.5。编码能力较前代大幅跃升,Terminal-Bench 4.0 得分从 10.3% 升至 70.6%,CursorBench 4.0 得分 55.5%,仅比 Opus 5.5 低约两分。
推荐理由:原文给出了 Sonnet 5.5 与 Opus 5.5 及前代的基准对比和定价,读者可据此判断中端模型的实际性价比。
Anthropic 发布其中端模型 Sonnet 5.5,称其比前代快 30%,token 消耗率显著降低,适合编码和办公文档等日常任务。Anthropic 的基准测试显示,Sonnet 5.5 在智能体编码上表现优于 Opus 5.5,且具备与 Opus 5 相当的网络安全能力,成为首个适用同等网络安全防护措施的 Sonnet 模型。公司还计划在未来几周发布最小模型 Haiku 的新版本。
Hugging Face 发布 Holo4 系列智能体模型,含 27B dense 和 35B-A3B MoE 两个尺寸,均已在 H Models API 上线,并同步开源 Holotron4 Nano。
推荐理由:原文给出了新模型的双尺寸、跨界面能力和开源轨迹数据,读者可据此评估它在真实业务工作流中的性价比。
Liquid AI 发布 LFM2.5-VL-3B 的实验性 DSpark 草稿模型,通过投机解码在几乎不增加内存的前提下提升推理速度,解码加速最高达 3.13x(设备端)和 2.66x(H100),端到端提升最高 2.62x 和 2.27x。
推荐理由:原文给出了解码加速倍数、内存开销和三种推理框架的接入方式,读者可据此评估端侧视觉模型的推理收益。
Anthropic 发布 Claude Opus 5.5,称多数任务性能接近 Fable 5.1,运行成本比 Opus 5 低 40%,速度提升约 30%,并成为 Claude Code 和 Claude 应用的默认模型。
推荐理由:原文梳理了 Claude Opus 5.5 与 GPT-6 Sol/Luna 同日发布的定价、评测与安全争议,读者可据此对比两家实验室的竞争策略。
Anthropic 发布 Opus 5.5,声称相比 Opus 5 在默认设置下典型工作负载成本降低约 40%,因 token 价格下降且完成任务所需 token 更少,并在网络安全和生物学等高风险领域能力突出,相关请求可能被自动路由到旧模型。OpenAI 发布 GPT-6 Sol 和 Luna,作为 Astra 的迭代版本,部分基准测试中比前代能力提升几个百分点,但使用成本减半。
OpenAI 的 GPT-6 Sol 和 GPT-6 Luna 现已在 Amazon Bedrock 上正式可用,两者 API 定价均显著低于 GPT-5.6 前代。
推荐理由:原文给出了两款模型的分工定位、降价幅度和提示词缓存能力,读者可据此判断如何按负载匹配模型。
OpenAI 发布 GPT-6 Sol 和 Luna 两款模型,以不同的能力与成本平衡将前沿智能带入日常工作。
Claude Opus 5.5 现已在 Amazon Bedrock 和 Claude Platform on AWS 上线,是 Claude 5.5 系列的首个模型。相比 Opus 5,它用更少 token 完成任务,平均单任务成本更低,并首次配备生物、网络安全和 AI 开发领域的安全分类器。模型支持自适应思考,可通过 effort 控制推理量,适用于智能体编码和长文档知识工作。
推荐理由:原文给出了新模型的效率、定价与安全分类器变化,读者可据此评估其在长任务和智能体编码场景的适用性。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次提交中,Qwen3-VL 吞吐量比 GB300 NVL72 最高提升 3.7 倍,DeepSeek-R1 最高提升 2.5 倍。GB300 NVL72 在 288 GPU 规模下实现 99% 扩展效率,软件优化带来最高 1.6 倍性能提升。Nebius 等 19 家合作伙伴也提交了结果。
推荐理由:原文给出 Vera Rubin NVL72 在 MLPerf 推理基准上的首秀成绩与对比数据,读者可据此评估新一代平台的推理性能与扩展效率。
Salesforce 在 Dreamforce 上发布其首个 CRM 推理模型 Koa,基于 NVIDIA Nemotron 3 Super 后训练而成,使用近三十年企业 CRM 部署数据的专有合成数据集。
推荐理由:原文给出了 Koa 的构建方式、性能数据和开放时间,读者可以据此判断它对企业 CRM 工作流的影响。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音对话模型,前者面向规模与成本效率,后者面向高复杂度任务。
推荐理由:官方给出了两个新模型的定位差异、基准成绩和开放渠道,读者可据此判断它们适合哪些语音智能体场景。
OpenAI 推出 GPT-6 Astra,定位其最具商业能力的模型,具备高级推理、计算机使用能力,以及更强的写作与设计判断力。该模型面向工作场景,旨在提升企业级任务的智能化水平。
OpenAI 分享了一个由 AI 生成的 Navier–Stokes 千禧年大奖问题解法,包含问题论述和一份 Lean 形式化证明。该解法以 AI 生成的方式呈现,并附有形式化验证,但尚未提及是否通过官方评审或正式获奖。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为目前最先进、最准确的全球天气模型。
推荐理由:原文给出了分辨率、更新频率和降水精度等关键指标,读者可据此判断新一代天气模型的实际能力提升。
Hugging Face 发布 NeoMME,一个 260M 和 800M 的多语言多模态编码器家族,用单一双向 Transformer 同时处理文本 token 和原始图像块,从零训练,不使用预训练视觉塔或因果语言模型。
推荐理由:原文给出了模型架构、检索性能和压缩方案,读者可据此评估其在视觉文档检索中的适用性。
OpenAI 发布 GPT-6 Astra,称其为迄今最智能且对齐程度最高的模型,在计算机使用、编码、网络安全和科学领域具备领先能力。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。
Google Research 发布 TimesFM-3,这是其时序基础模型家族的新一代版本,原生预训练用于多变量预测,参数量 3.3 亿,在超过 1 万亿时间点的真实与合成语料上完成预训练。
推荐理由:原文给出了模型架构、参数量、评测排名和开放入口,读者可据此判断它相对单变量模型的提升幅度。
微软研究院发布 GigaPath-Flash 与 GigaTIME-Flash,通过知识蒸馏将十亿参数编码器压缩为 22M 参数的 ViT-S 骨干,在保持约 97% 预测性能的同时将全切片分析计算量降低约 50 倍,空间蛋白组学预测提速约 6 倍、显存减少约 8 倍。两模型均以 Apache 2.0 协议开放权重,代码与权重已上架 Hugging Face,面向科研用途而非临床诊疗。
推荐理由:原文给出了蒸馏压缩后的效率提升和开放权重入口,读者可据此评估病理基础模型在更大队列研究中的实用成本。
Google DeepMind 发布 Gemini Omni 1.1 Flash,通过 Gemini API 在 Google AI Studio 提供面向专业用途的生成式视频能力。
推荐理由:官方介绍了场景扩展、首尾帧控制、4K 放大等新能力,读者可据此判断它是否适合接入自己的视频生成工作流。
Google DeepMind 发布 Gemini 3.5 Transcribe,这是其最精确的语音转文字模型,支持实时流式与预录音频处理,可通过 Gemini API 在 Google AI Studio 和 Gemini Enterprise Agent Platform 使用。
推荐理由:原文给出了新模型的精度、延迟和开放入口,读者可以据此判断它相比 Chirp 3 的实际提升。
IBM 发布 Granite 4.2 推理模型家族,包含 3B、8B、30B 三个尺寸,均基于 Granite-4.1 基座模型后训练而来,采用多阶段强化学习流水线,其中 8B 和 30B 额外经过智能体强化学习,可在真实沙箱环境中调用工具、编辑代码、操作终端和搜索网页。所有模型均支持思考与非思考模式切换、低努力思考模式及原生工具调用,以 Apache 2.0 协议开源。
推荐理由:IBM 官方详解 Granite 4.2 推理模型家族的构建过程,读者可借此了解其多阶段强化学习与智能体训练的具体做法。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,是面向编码和智能体场景的最强工作模型。
推荐理由:官方给出了编码、网页开发与知识工作场景的基准提升和半价定价,读者可据此评估升级价值。
Google DeepMind 发布大规模多语种手语转文本模型 SL2T,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中实现美国手语(ASL)到英语的听写。模型基于超过 10 万小时、50 多种手语数据训练,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩,并采用姿态关键点而非原始视频以保护隐私。
推荐理由:原文给出了 SL2T 的训练规模、基准成绩和落地入口,读者可据此判断手语 AI 从实验室走向消费产品的实际进展。
Meta 今日发布 Muse Glimmer,一个从 Muse 蒸馏到 30B 参数的多模态模型,专为本地智能体场景设计,采用 Apache 2.0 许可。模型由 2B 视觉编码器和 28B 文本解码器组成,支持图像、视频输入及多模态工具调用,并附带 DFlash 投机解码加速。
推荐理由:原文给出架构细节、基准对比和本地部署路径,读者可据此评估它在端侧智能体场景的适用性。
Google DeepMind 在 Nature 发表论文并开源 WeatherNext 2 和 WeatherNext Cyclones 模型,其气旋预报精度达到 SOTA,平均比此前模型多出一天以上的提前量,相当于气象学约十年的进步。
推荐理由:原文给出了模型精度提升、开源范围和实际应用案例,读者可以据此判断该模型对气象预报领域的具体价值。
Mistral 发布 Shieldstral,一个 3B 开源多模态安全审核模型,在文本安全上匹配最高 7 倍规模的模型,并在多模态审核上达到新 SOTA。它把内容审核建模为策略自适应问答,推理时用自然语言问题定义策略,无需重训即可统一审核文本和图像,返回校准的安全分数。模型以 Apache 2.0 开源,可在单张 16GB NVIDIA GPU 上运行。
推荐理由:原文给出了把内容审核建模为策略自适应问答的思路,读者可以据此判断这种免重训的审核方式是否适合自身场景。
微软研究院开源 Orchard,一个面向可扩展智能体 AI 研究的框架,核心是 Kubernetes 环境服务 Orchard Env,支持软件工程、网页导航和个人助理三类智能体,并可直接在 Codex、OpenClaw 等真实部署 harness 中训练。
推荐理由:原文给出了开源框架、三个训练配方和关键基准成绩,读者可据此判断小模型在真实部署环境中的训练路径是否可复用。
Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,支持视频理解、任务编排和多机器人协作,可将动作执行交给任意底层 VLA 模型。
推荐理由:原文给出了新模型的三大能力升级和公开开放入口,读者可据此判断它如何改变机器人任务编排与多机协作的开发方式。
Google DeepMind 发布新一代音乐生成模型 Lyria 3.5,今日在 Google Flow Music 中上线。新版本在音乐性、歌词、人声和创作控制四方面提升:支持更自然丰富的旋律结构、更高品质的歌词生成、更具表现力和情感的人声,并允许用户更轻松地控制输出节奏和时长。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:Gemini Robotics 2 是最先进的视觉-语言-动作模型(VLA)。
推荐理由:原文给出了三款模型的分工和开放入口,读者可据此判断具身智能模型的能力边界与接入方式。
Google DeepMind 发布三款新 Gemini 模型。Gemini 3.6 Flash 相比 3.5 Flash 减少 17% 输出 token 用量。
推荐理由:官方给出三款新模型的定价、token 效率与关键基准提升,读者可据此评估其在智能体工作流中的成本与性能取舍。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调而成的轻量网络安全模型,用于快速发现、验证和修复软件漏洞。
推荐理由:原文给出了轻量安全模型的定位、基准成绩和内部落地效果,读者可据此判断它在漏洞挖掘场景中的实际价值。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,约 1T 参数、支持 1M 上下文,原生接受图像、文本和音频输入,具备智能体能力,并提供 BF16 和 NVFP4 变体。
推荐理由:原文给出了 Inkling 的架构细节、部署配置和基准表现,读者可以据此判断它作为开源多模态模型的定位与可用性。
Mistral AI 发布 Robostral Navigate,一个 8B 参数的具身导航模型,仅用单个 RGB 摄像头即可让机器人自主导航,在 R2R-CE 验证 unseen 上取得 76.6% 成功率,超过使用深度或多摄像头的最佳系统 4.5 个点。模型完全在模拟环境中训练,通过指向式导航和在线强化学习(CISPO)持续改进,可运行于轮式、腿式和飞行机器人。
推荐理由:原文给出了单摄像头导航模型在 R2R-CE 上的成绩和训练方法,读者可据此判断它相对多传感器方案的效率优势。
Mistral 发布 Leanstral 1.5,一款 Apache-2.0 许可、总参数 119B 但仅 6B 激活的开源模型,在 miniF2F 上达到 100%,解决 PutnamBench 587/672 题,并在 FATE-H(87%)和 FATE-X(34%)上取得新 SOTA。
推荐理由:原文给出了基准成绩、成本对比和真实代码库找 bug 的案例,读者可据此判断它在形式化验证上的实用程度。