Diffusers 原生支持 Nunchaku 4-bit 扩散推理
Hugging Face 宣布 Diffusers 现已原生支持 Nunchaku 4-bit 扩散推理,加载预量化 checkpoint 只需调用 from_pretrained(),无需本地 CUDA 编译。
推荐理由:官方博客说明 Nunchaku 4-bit 扩散推理已原生接入 Diffusers,读者可据此判断量化推理的落地方式与收益。
Hugging Face 宣布 Diffusers 现已原生支持 Nunchaku 4-bit 扩散推理,加载预量化 checkpoint 只需调用 from_pretrained(),无需本地 CUDA 编译。
推荐理由:官方博客说明 Nunchaku 4-bit 扩散推理已原生接入 Diffusers,读者可据此判断量化推理的落地方式与收益。
本期 Import AI 周刊指出,英国 AISI 分析显示开源模型在网络安全能力上已接近闭源前沿,GLM-5.2 和 DeepSeek V4-Pro 的表现相当于数月前的闭源模型。
Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,约 1T 参数、支持 1M 上下文,原生接受图像、文本和音频输入,具备智能体能力,并提供 BF16 和 NVFP4 变体。
推荐理由:原文给出了 Inkling 的架构细节、部署配置和基准表现,读者可以据此判断它作为开源多模态模型的定位与可用性。
Hugging Face 宣布 vLLM 的 transformers 建模后端现已达到或超过手写原生实现的推理速度,在 Qwen3-4B、32B 和 235B MoE 三种模型上均验证通过。模型作者无需移植代码,只需在 vLLM 中加 --model-impl transformers 参数即可获得原生级推理性能,且该后端通过 torch.fx 和 AST 在运行时自动应用层融合优化。
推荐理由:原文给出实测对比和启用方式,读者可据此判断是否值得升级 vLLM 并切换后端。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,开发者可在支持的模型页一键点击“Customize on SageMaker AI”或“Deploy on SageMaker AI”,直接进入 SageMaker Studio 对应工作流,模型预载且环境自动配置。
微软在 Build 2026 上宣布 Foundry Managed Compute 支持 Hugging Face 模型,提供每周刷新的精选开源权重目录,可一键部署到托管 GPU 平台。
推荐理由:原文给出了模型目录、一键部署流程和运行时选型,读者可以据此评估在 Foundry 上托管开源模型的成本与运维方式。
LeRobot v0.6.0 正式发布,旨在闭环机器人学习流程。新版本引入三种世界模型策略(VLA-JEPA、LingBot-VA、FastWAM),新增多个 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),并推出统一的奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布 LeRobot v0.6.0,涵盖世界模型、新 VLA、奖励模型、评测基准与部署 CLI,可帮助读者了解开源机器人学习框架的最新能力。
SkyPilot 与 Hugging Face 联合推出 store: hf 后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,在 20+ 云、Kubernetes、Slurm 和本地集群上运行。
推荐理由:原文给出了 hf:// 挂载、零出口流量和 Xet 去重的具体机制与实测数字,读者可据此判断跨云训练的数据成本能省多少。
Hugging Face 发布 Kernels 项目重大更新,在 Hub 上引入新的 kernel 仓库类型,并默认只加载受信任发布者的内核,同时加入基于 Sigstore cosign 的代码签名机制。
推荐理由:原文梳理了内核仓库类型、签名验证和 CLI 重构等关键变化,读者可据此判断新内核工作流的安全边界与适配范围。
Mistral 发布 Leanstral 1.5,一款 Apache-2.0 许可、总参数 119B 但仅 6B 激活的开源模型,在 miniF2F 上达到 100%,解决 PutnamBench 587/672 题,并在 FATE-H(87%)和 FATE-X(34%)上取得新 SOTA。
推荐理由:原文给出了基准成绩、成本对比和真实代码库找 bug 的案例,读者可据此判断它在形式化验证上的实用程度。
伯克利人工智能研究实验室(BAIR)公布 2026 届博士毕业生去向,涵盖机器人、大语言模型、计算机视觉、AI 安全等领域。毕业生将前往 Physical Intelligence、OpenAI、Amazon、Mistral AI 等机构任职,或进入 UCLA、芝加哥大学等高校担任教职,也有毕业生正在创业并招募人才。
Hugging Face 与 Cerebras 合作推出实时语音 AI 演示,构建了全开源的级联式语音到语音流水线:语音输入经 Nvidia Parakeet 识别,由 Cerebras 上的 Gemma 4 31B 处理,再经阿里 Qwen3TTS 合成语音输出。该流水线已驱动超过 9,000 台 Reachy Mini 机器人,旨在通过低延迟和稳定推理改善对话的自然感。
推荐理由:原文展示了开源语音流水线与 Cerebras 推理速度结合后的实时对话体验,读者可据此评估端到端语音方案的延迟表现。
Every Eval Ever (EEE) 与 Hugging Face Community Evals 实现互通,支持评测结果跨平台发布与解读,并链接到开放模型、排行榜和统一元数据存储。
推荐理由:原文说明了 EEE 与 Hugging Face Community Evals 打通后的双向流程,读者可据此判断评测结果跨平台复用的实际路径。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。
推荐理由:原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。
Google DeepMind 发布 Gemma 4 12B,这是其首款支持原生音频输入的中型多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。
推荐理由:原文给出了架构变化、内存占用和开放入口,读者可据此判断它能否在本地硬件上跑起多模态智能体工作流。
Google Research 在 GitHub 上以 Apache 2.0 协议开源其水文建模框架,该框架基于 PyTorch 和 LSTM 架构,使用 Caravan 数据集训练,可复现 Google Flood Hub 的河流洪水预报能力。新版模型在基准测试中比旧版将可靠预测期延长六天(有水文站流域)和一天(无水文站流域),并已与捷克水文气象研究所合作集成到 Delft-FEWS 平台。
推荐理由:原文给出了模型架构、训练数据和基准提升,读者可据此评估将 AI 洪水预报接入本地工作流的可行性。
Google Research 在 I/O 2026 上发布多项成果,包括面向科学研究的 Gemini for Science 工具套件(含 Computational Discovery、Hypothesis Generation 等)、升级的智能体开发平台 Antigravity 2.0,以及基于 Coral NPU 的 Synaptics Coralboard 开发板。
推荐理由:原文汇总了 Gemini for Science、Antigravity 2.0、Coralboard 等多项发布,读者可借此把握 Google 在科学研究和开发者工具上的整体布局。
Mistral 在 AI Now Summit 2026 上发布面向工业工程的集成 AI 栈,与 Airbus、BMW、ASML 合作优化设计、仿真与生产,并强调数据安全。其智能体工具 Vibe 升级为可处理编码、研究等长周期任务的统一智能体,同时宣布在法国 Les Ulis 建设 10 MW 推理数据中心,计划 2026 年 Q3 启用。
推荐理由:原文给出工业工程 AI 栈、Vibe 智能体升级和法国数据中心三项动作,读者可据此了解 Mistral 面向企业关键流程的布局。
Mistral 发布旗舰模型 Mistral Medium 3.5,这是一个 128B 稠密模型,拥有 256k 上下文窗口,采用修改版 MIT 许可开放权重,可在最少四张 GPU 上自托管,SWE-Bench Verified 得分 77.6%。
推荐理由:原文给出了新模型的规模、价格和开放权重,读者可以据此判断它是否适合自托管或接入现有编码工作流。
Google Research 通过开源软件和开放数据集推动科学突破,其工具已赋能全球超过 25 万研究人员和开发者。相关成果包括处理 250 万例全外显子组和全基因组、Open Buildings 含 18 亿建筑检测、HAI-DEF 下载超 480 万次,并与 UCSC 合作将基因变异识别错误率降低 50%。
Apache APISIX 3.16.0 版本发布。官方提醒 GitHub 并非正式发布或归档区域,用户应从官方下载页面和归档页面获取源代码。
Google DeepMind 发布 Gemma 4 开源模型家族,号称迄今最智能的开源模型,专为高级推理和智能体工作流设计,以 Apache 2.0 许可发布。
推荐理由:官方发布稿给出了四个尺寸、上下文窗口和硬件适配细节,读者可据此判断在自有硬件上运行与微调的可行性。
Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,4B 参数,支持 9 种语言,具备情感表达、低延迟和零样本跨语言声音适配。模型基于 Ministral 3B,采用 Transformer 自回归流匹配架构,模型延迟 70ms,实时因子约 9.7x。
推荐理由:原文给出了模型架构、定价和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的适用性。
Mistral 发布 Mistral Small 4,这是首个统一旗舰模型能力的开源模型,融合 Magistral 的推理、Pixtral 的多模态和 Devstral 的编码智能体能力。
推荐理由:原文给出了架构、性能提升和开放入口,读者可以据此判断它如何统一推理、多模态与编码能力。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,与 NVIDIA 联合开发开源前沿模型,结合其模型架构与 NVIDIA 的算力及合成数据管线。
Mistral 发布 Leanstral,首个面向 Lean 4 的开源代码智能体,权重以 Apache 2.0 协议开源,并集成进 Mistral Vibe 和免费 API 端点。
推荐理由:原文给出了 Leanstral 的架构、评测分数和成本对比,读者可据此判断它在形式化证明场景中的性价比。
Google Research 发布 WAXAL,一个开放获取的非洲语言语音数据集,初始覆盖 27 种撒哈拉以南非洲语言,包含约 1,846 小时 ASR 转写语音和超过 565 小时 TTS 高保真录音,采用 CC-BY-4.0 许可。数据由非洲学术和社区组织主导收集,旨在赋能区域 AI 生态,构建更贴合当地语言多样性的语音系统。
推荐理由:原文给出了数据规模、许可方式和合作模式,读者可以据此判断它如何缓解非洲语言语音数据稀缺问题。
Mistral 发布 Voxtral Transcribe 2,包含 Voxtral Mini Transcribe V2 和 Voxtral Realtime 两款模型。
推荐理由:原文给出了两款模型的定位、价格和开源情况,读者可据此评估语音转录方案的性价比与部署选择。
Portkey Gateway v1.15.2 发布,主要更新包括:支持 Azure Blob 批量处理、允许自定义范围与 Azure Agents 配合使用、统一 Anthropic beta 头使用,并修复了顺序 guardrails 仅执行已启用检查的行为问题。此外,更新了 README 并升级了 Vercel Cookbook 包版本。
Portkey Gateway v1.15.0 发布,新增对 Gemini 3 Pro 的思考能力支持、Anthropic 模型在 Azure 上的支持、Oracle 与 OVHcloud AI Endpoints 等新供应商,并加入 IO Intelligence 与 AI Badgr 等 OpenAI 兼容提供商。
Mistral AI 发布下一代编码模型 Devstral 2(123B)和 Devstral Small 2(24B),均采用宽松开源许可,Devstral 2 在 SWE-bench Verified 上取得 72.2% 的成绩,并推出原生 CLI 工具 Mistral Vibe 实现端到端代码自动化。
推荐理由:原文给出了新模型在 SWE-bench Verified 上的得分、与闭源模型的差距以及 API 定价,读者可据此判断开源编码模型的实际水平与成本。
Mistral 发布下一代模型 Mistral 3,包含 14B、8B、3B 的 Ministral 3 系列和旗舰 Mistral Large 3,全部采用 Apache 2.0 许可证。
推荐理由:原文给出了 Mistral 3 全家族参数、许可证和可用平台,读者可据此判断开源模型的最新能力水位与部署选择。
Mistral AI 宣布与 SAP 建立多年合作,为德国和欧洲提供完全主权的 AI 技术栈,将其模型集成至 SAP 的 AI Foundation,并共同开发面向复杂行业与行政机构的解决方案。同时与 Helsing 合作加速视觉-语言-动作模型在国防与安全领域的开发。公司还计划未来数月内在德国开设办公室并大幅扩充本地团队。
Mistral AI 宣布完成 17 亿欧元 C 轮融资,投后估值 117 亿欧元,由半导体设备制造商 ASML 领投,DST Global、Andreessen Horowitz、Bpifrance、General Catalyst、Index Ventures、Lightspeed 和 NVIDIA 等现有投资者参投。
Mistral 发布 Codestral 25.08,接受补全提升 30%、保留代码增加 10%、失控生成减少 50%,并推出包含 Devstral、Codestral Embed 和 Mistral Code 插件的完整企业编码栈,支持云端、VPC 或本地部署。Capgemini、Abanca、SNCF 等企业已在生产环境使用该方案。
推荐理由:原文给出了 Codestral 25.08 的量化提升和完整企业级编码栈的部署方式,读者可据此评估自托管方案的价值。
Mistral AI 发布开源语音理解模型 Voxtral,提供 24B 生产级和 3B 端侧两个版本,均采用 Apache 2.0 许可并开放 API。Voxtral 支持 32k token 上下文、最长 30 分钟转写或 40 分钟理解、内置问答与摘要、多语言识别及语音直接触发函数调用。
推荐理由:原文给出了两个开源语音模型的规模、许可和定价,读者可据此评估其在生产场景中的成本与部署选择。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium,并升级 Devstral Small 1.1。
推荐理由:原文给出了两款模型的基准分数、定价和开源范围,读者可据此评估其在编码智能体场景的性价比。
Mistral AI 宣布推出 Mistral Compute,一项面向主权国家、企业和研究机构的全新 AI 基础设施服务,提供从裸金属服务器到全托管 PaaS 的私有集成堆栈,涵盖 GPU、编排、API、产品与服务。
Mistral AI 发布其首款推理模型 Magistral,分为 24B 参数的开源版 Magistral Small 和企业版 Magistral Medium。
推荐理由:Mistral 首次推出推理模型,开源版与商业版并行,读者可据此评估其多语言透明推理能力与部署选择。
Mistral 发布企业级 AI 编程助手 Mistral Code,整合 Codestral、Devstral 等四款模型与 IDE 插件、本地部署和企业工具,支持微调与私有化部署。产品基于开源项目 Continue 构建,今日开放 JetBrains 和 VSCode 的私有测试,已获 Abanca、SNCF 和 Capgemini 等企业采用。
推荐理由:原文给出了产品定位、部署方式和客户案例,读者可以据此判断企业级 AI 编程助手市场的竞争格局。