跳到正文

#模型发布

今日 6 条
7月15日周三
  1. Hugging Face Blog82

    Thinking Machines 发布开源多模态模型 Inkling 及 Inkling-Small

    Thinking Machines 在 Hugging Face 发布开源多模态模型 Inkling,约 1T 参数、支持 1M 上下文,原生接受图像、文本和音频输入,具备智能体能力,并提供 BF16 和 NVFP4 变体。

    推荐理由:原文给出了 Inkling 的架构细节、部署配置和基准表现,读者可以据此判断它作为开源多模态模型的定位与可用性。

7月8日周三
  1. Mistral AI62

    Mistral AI 发布 Robostral Navigate 具身导航模型

    Mistral AI 发布 Robostral Navigate,一个 8B 参数的具身导航模型,仅用单个 RGB 摄像头即可让机器人自主导航,在 R2R-CE 验证 unseen 上取得 76.6% 成功率,超过使用深度或多摄像头的最佳系统 4.5 个点。模型完全在模拟环境中训练,通过指向式导航和在线强化学习(CISPO)持续改进,可运行于轮式、腿式和飞行机器人。

    推荐理由:原文给出了单摄像头导航模型在 R2R-CE 上的成绩和训练方法,读者可据此判断它相对多传感器方案的效率优势。

7月2日周四
  1. Mistral AI82

    Mistral 发布 Leanstral 1.5,6B 激活参数开源模型在形式化验证上刷新多项基准

    Mistral 发布 Leanstral 1.5,一款 Apache-2.0 许可、总参数 119B 但仅 6B 激活的开源模型,在 miniF2F 上达到 100%,解决 PutnamBench 587/672 题,并在 FATE-H(87%)和 FATE-X(34%)上取得新 SOTA。

    推荐理由:原文给出了基准成绩、成本对比和真实代码库找 bug 的案例,读者可据此判断它在形式化验证上的实用程度。

6月30日周二
  1. Google Research77

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、调参和特征工程。模型采用交替行列注意力、行压缩和 ICL 混合架构,完全在数亿个合成数据集上训练,在 TabArena 基准上覆盖 38 个分类和 13 个回归数据集。

    推荐理由:原文给出了模型架构、训练方式和在 TabArena 上的评测结果,读者可据此判断零样本表格预测的实际能力。

6月11日周四
  1. Google DeepMind79

    Google DeepMind 发布开源扩散模型 DiffusionGemma,推理速度最高提升 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。

    推荐理由:原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。

6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是最新的音频模型,支持 70 多种语言的近实时语音到语音翻译,能保留说话者的语调、节奏和音高,并连续生成语音而非逐轮等待。

    推荐理由:原文给出了新模型的连续语音翻译能力、覆盖语言数和各产品入口,读者可据此判断它如何改变跨语言实时沟通。

5月22日周五
  1. Mistral AI80

    Mistral 发布 Mistral Medium 3.5,并推出云端远程编码智能体

    Mistral 发布旗舰模型 Mistral Medium 3.5,这是一个 128B 稠密模型,拥有 256k 上下文窗口,采用修改版 MIT 许可开放权重,可在最少四张 GPU 上自托管,SWE-Bench Verified 得分 77.6%。

    推荐理由:原文给出了新模型的规模、价格和开放权重,读者可以据此判断它是否适合自托管或接入现有编码工作流。

5月18日周一
5月16日周六
  1. Google DeepMind85

    Google DeepMind 发布 Gemini 3.5,率先推出 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。

    推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。

5月6日周三
  1. Google DeepMind80

    AlphaEvolve 发布一周年:Gemini 驱动的编码智能体在多领域展现影响

    Google DeepMind 发布 AlphaEvolve 一周年总结,该 Gemini 驱动的编码智能体已在数学、物理、基因组学、电网优化等领域取得进展,并开始服务商业客户。

    推荐理由:原文汇总了 AlphaEvolve 在健康、能源、科研和商业等领域的落地成果,读者可据此评估其跨领域应用价值。

4月13日周一
4月3日周五
3月24日周二
  1. Mistral AI77

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布 Voxtral TTS,这是其首个文本转语音模型,4B 参数,支持 9 种语言,具备情感表达、低延迟和零样本跨语言声音适配。模型基于 Ministral 3B,采用 Transformer 自回归流匹配架构,模型延迟 70ms,实时因子约 9.7x。

    推荐理由:原文给出了模型架构、定价和与 ElevenLabs 的人工评测对比,读者可据此判断其在语音智能体场景的适用性。

3月17日周二
12月17日周三
  1. Mistral AI62

    Mistral 发布 OCR 3,文档解析性能大幅提升

    Mistral 发布 OCR 3,在表单、扫描件、复杂表格和手写内容上对 OCR 2 取得 74% 综合胜率,支持输出带 HTML 表格结构的 markdown。定价为每 1000 页 2 美元,Batch API 五折后降至 1 美元,模型 mistral-ocr-2512 已通过 API 和 Mistral AI Studio 的 Document AI Playground 开放使用。

    推荐理由:原文给出了 OCR 3 相对上一代的性能提升、定价与开放入口,读者可据此评估其在文档解析管线中的适用性。

12月9日周二
  1. Mistral AI82

    Mistral AI 发布 Devstral 2 编码模型与 Mistral Vibe CLI

    Mistral AI 发布下一代编码模型 Devstral 2(123B)和 Devstral Small 2(24B),均采用宽松开源许可,Devstral 2 在 SWE-bench Verified 上取得 72.2% 的成绩,并推出原生 CLI 工具 Mistral Vibe 实现端到端代码自动化。

    推荐理由:原文给出了新模型在 SWE-bench Verified 上的得分、与闭源模型的差距以及 API 定价,读者可据此判断开源编码模型的实际水平与成本。

12月3日周三
7月15日周二
  1. Mistral AI78

    Mistral 发布开源语音理解模型 Voxtral,提供 24B 与 3B 两个版本

    Mistral AI 发布开源语音理解模型 Voxtral,提供 24B 生产级和 3B 端侧两个版本,均采用 Apache 2.0 许可并开放 API。Voxtral 支持 32k token 上下文、最长 30 分钟转写或 40 分钟理解、内置问答与摘要、多语言识别及语音直接触发函数调用。

    推荐理由:原文给出了两个开源语音模型的规模、许可和定价,读者可据此评估其在生产场景中的成本与部署选择。

7月11日周五
6月10日周二
5月28日周三
  1. Mistral AI62

    Mistral 发布首个代码专用嵌入模型 Codestral Embed

    Mistral AI 发布 Codestral Embed,这是其首个专为代码设计的嵌入模型,在真实代码数据的检索场景中表现突出,显著优于 Voyage Code 3、Cohere Embed v4.0 和 OpenAI 的大型嵌入模型。

    推荐理由:原文给出了首个代码专用嵌入模型的性能对比、定价和分块建议,读者可据此评估其在代码检索场景的适用性。

5月21日周三
  1. Mistral AI75

    Mistral AI 发布开源编码智能体 Devstral

    Mistral AI 与 All Hands AI 合作推出面向软件工程任务的智能体大模型 Devstral,在 SWE-Bench Verified 上取得 46.8% 的成绩,超过此前开源最优模型 6 个百分点以上,并以 Apache 2.0 协议免费开源。

    推荐理由:原文给出了基准成绩、开源许可和本地部署门槛,读者可据此评估它作为开源编码智能体的实际可用性。

5月7日周三
  1. Mistral AI74

    Mistral AI 发布 Mistral Medium 3,主打低成本高性能

    Mistral AI 发布 Mistral Medium 3,在多数基准上达到 Claude Sonnet 3.7 的 90% 以上性能,定价为每百万 token 输入 $0.4、输出 $2,成本显著更低。该模型在编码和 STEM 任务上接近更大规模的竞品,并支持混合部署或本地 VPC 部署,API 即日起在 Mistral La Plateforme 和 Amazon Sagemaker 上线。

    推荐理由:原文给出了性能对比和定价,读者可以据此判断中等规模模型在成本与能力之间的取舍。

3月17日周一
  1. Mistral AI72

    Mistral Small 3.1 发布:128k 上下文、多模态、Apache 2.0 开源

    Mistral AI 发布 Mistral Small 3.1,在文本性能、多模态理解和 128k 上下文窗口上较前代升级,推理速度达每秒 150 tokens,性能超越 Gemma 3 和 GPT-4o Mini,并以 Apache 2.0 许可开源。

    推荐理由:官方公布了性能对比、推理速度和开源许可,读者可据此判断它相对同类小模型的定位与适用场景。