vLLM 发布 Kimi K3 的 day-0 高效支持
vLLM 宣布对 Moonshot AI 的 Kimi K3 提供 day-0 支持,该模型为 2.8 万亿参数 MoE,每 token 激活 896 个专家中的 16 个,支持 1M token 上下文和原生视觉。
推荐理由:vLLM 给出 Kimi K3 的 day-0 部署配方与实测吞吐,可据此判断 2.8T 混合 MoE 的落地成本。
把模型跑起来的工程实践:推理优化、显存与成本、Serving 架构与基础设施选型。
vLLM 宣布对 Moonshot AI 的 Kimi K3 提供 day-0 支持,该模型为 2.8 万亿参数 MoE,每 token 激活 896 个专家中的 16 个,支持 1M token 上下文和原生视觉。
推荐理由:vLLM 给出 Kimi K3 的 day-0 部署配方与实测吞吐,可据此判断 2.8T 混合 MoE 的落地成本。
Hugging Face 宣布 Diffusers 现已原生支持 Nunchaku 4-bit 扩散推理,加载预量化 checkpoint 只需调用 from_pretrained(),无需本地 CUDA 编译。
推荐理由:官方博客说明 Nunchaku 4-bit 扩散推理已原生接入 Diffusers,读者可据此判断量化推理的落地方式与收益。
vLLM 发布博客,预览为 Moonshot AI 的 Kimi K3 提供的 day-0 开源推理支持,涵盖模型实现、Docker 镜像、部署配方与生产验证。
推荐理由:原文披露了 vLLM 为 Kimi K3 做的 KDA 前缀缓存改造与内核优化细节,可了解混合注意力模型的推理适配难点。
OpenRouter 发布教程,说明提示词缓存与粘性路由如何降低多轮智能体的 token 成本:缓存读取按正常输入价的 0.1x 到 0.5x 计费,Anthropic Claude Sonnet 4.6 的缓存读取为 $0.30/M,对比输入价 $3.00/M 正好是 0.1x。
推荐理由:原文给出各家缓存读写倍率与 session_id 粘性路由的配置方法,可据此估算多轮智能体的成本。
OpenRouter 宣布所有模态都可通过单一 OpenAI 兼容 base URL https://openrouter.ai/api/v1 调用,覆盖 400+ 模型、70+ 提供商,切换模态只需改 model 字符串和 content type。
推荐理由:原文把多模态调用统一到一个 base URL 的端点映射和路由限制讲清楚了,便于评估接入成本。
IBM Research 在博客中分享构建智能体路由器的经验,指出模型选择实际是系统优化问题。实测中 GPT-4.1 在 AppWorld 测试上成本是 Claude Sonnet 4.6 的近两倍,原因是缓存命中率差异;任务难度在路由时往往不可见,且需同时权衡成本、延迟、合规等多重因素。他们的优化算法在保持轻量(每任务约 6 ms、2 kB 内存)的同时,提供了成本、延迟、精度之间的可调操作点。
推荐理由:作者用实测数据拆解了路由优化的三个隐藏维度,读者可据此重新审视自家智能体系统的成本与延迟优化思路。
Hugging Face 发布 PyTorch 性能剖析系列第三篇,用 profiler 对比朴素注意力、原地掩码、SDPA 的 math、efficient、flash 和 cuDNN 后端。
推荐理由:用可复现脚本逐层对比注意力各实现的 profiler 足迹,能帮读者建立先猜测再验证的调优习惯。
Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到或超过手写原生实现的推理速度,在 Qwen3-4B、32B 和 235B MoE 三种模型上均验证通过。模型作者无需移植代码,只需在 vLLM 中加 --model-impl transformers 参数即可获得原生级推理性能,且该后端通过 torch.fx 和 AST 在运行时自动应用层融合优化。
推荐理由:原文给出实测对比和启用方式,读者可据此判断是否值得升级 vLLM 并切换后端。
微软在 Build 2026 上宣布 Foundry Managed Compute 支持 Hugging Face 模型,提供每周刷新的精选开源权重目录,可一键部署到托管 GPU 平台。
推荐理由:原文给出了模型目录、一键部署流程和运行时选型,读者可以据此评估在 Foundry 上托管开源模型的成本与运维方式。
SkyPilot 与 Hugging Face 联合推出 store: hf 后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,在 20+ 云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出了 hf:// 挂载、零出口流量和 Xet 去重的具体机制与实测数字,读者可据此判断跨云训练的数据成本能省多少。
Hugging Face 发布 Kernels 项目重大更新,在 Hub 上引入新的 kernel 仓库类型,并默认只加载受信任发布者的内核,同时加入基于 Sigstore cosign 的代码签名机制。
推荐理由:原文梳理了内核仓库类型、签名验证和 CLI 重构等关键变化,读者可据此判断新内核工作流的安全边界与适配范围。
加州大学圣迭戈分校在 Google 支持下,计划将退役 Pixel 手机的主板提取并组成集群,部署一个由 2000 部手机组成的数据中心,为数百名研究人员和学生提供低成本、低碳的云计算服务。早期实验显示,20 部手机组成的集群即可支持 75 人以上班级的峰值提交,延迟低于 AWS 默认后端;该系统预计于 2026 年秋季上线。
推荐理由:原文给出了旧手机集群的计算能力对比和部署计划,读者可以据此评估这种低碳算力方案的可行性。
Cloudflare 在 AI Gateway 中推出花费上限功能,以美元为单位按模型、提供商或自定义属性设置预算,实时跟踪累计花费,超限默认拦截请求,也可通过 Dynamic Routes 降级到备用模型,现已面向所有套餐开放公测。
推荐理由:原文给出按美元计费的花费上限与身份归因方案,可了解团队级 AI 成本控制的具体做法。
Mistral 宣布推出物理 AI,将 Emmi AI 纳入其企业解决方案,用于 AI 原生工业工程。物理 AI 从求解器输出中学习,在单张 GPU 上数秒内完成正向预测,适用于航空航天、汽车、半导体、能源等领域,并与 ASML、Airbus、Safran、Siemens Energy 等伙伴合作。传统求解器仍用于验证和边缘情况。
推荐理由:原文解释了物理 AI 与传统求解器的分工,以及它在产品设计、制造和数字孪生上的加速价值,可据此判断其适用场景。
Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。
推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。
Mistral AI 发布 Workflows 编排层公开预览,为 AI 流程提供持久执行、可观测性和人工审批,支持从概念验证到生产环境的可靠运行。Workflows 是 Studio 的一部分,开发者用 Python 编写流程后可发布到 Le Chat 供组织内触发,每一步在 Studio 中可追踪审计。
推荐理由:原文给出了编排层的核心能力、部署模型和真实客户案例,读者可据此判断它如何把 AI 流程从概念验证推进到生产。
Google DeepMind 发布新论文,提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛,通过异步数据流隔离局部故障,使系统在硬件故障时仍能保持高可用性。实测中,该架构用 2-5 Gbps 带宽在四个美国区域成功训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持混用 TPU v6e 和 TPU v5p 等不同代际硬件。
推荐理由:原文给出了跨数据中心训练的新架构及其在带宽、容错和硬件混用上的实测结果,读者可据此评估分布式训练的新路径。
Cloudflare 公开其内部 AI 代码审查系统,基于开源编码智能体 OpenCode 构建 CI 原生编排层,由协调智能体调度最多七个专项审查智能体,覆盖安全、性能、代码质量、文档、发布管理和内部合规。
推荐理由:Cloudflare 公开了内部 AI 代码审查系统的插件架构、模型分层与成本数据,可迁移到自建 CI 审查流程。
Cloudflare 将 AI Gateway 与 Workers AI 整合为统一推理层,用一个 API 接入 12+ 家提供商的 70+ 模型,Workers 用户可用同一 AI.run() 绑定一行代码切换模型,REST API 支持将在未来几周推出。
推荐理由:原文给出统一推理层的能力边界与接入方式,读者可据此判断多模型智能体架构的落地路径。
Mistral AI 发布 Spaces CLI,一个面向人类开发者和编码智能体的命令行工具,可用三条命令完成项目脚手架、开发环境启动和部署。其核心设计原则是每个交互输入都有对应的 flag 等价物、每个 flag 都有无头模式下的智能默认值、状态显式化,并通过生成 context.json 和 AGENTS.md 文件帮助智能体理解项目。
推荐理由:Mistral 公开了 Spaces CLI 的完整设计原则,读者可借鉴其让 CLI 同时服务人类与智能体的具体做法。