TypeSafe 发布 Jev:面向决策而非文本生成的 System One 模型
TypeSafe 发布 Jev,一个经 RLCD 训练、面向决策而非文本生成的模型,宣称比小型前沿 LLM 快 20-200 倍、便宜 40-400 倍,输出 token 免费。社区指出它并非通用语言模型,不能生成自由文本,需预定义输出格式,更适合作为结构化分类器、裁判或路由策略。
TypeSafe 发布 Jev,一个经 RLCD 训练、面向决策而非文本生成的模型,宣称比小型前沿 LLM 快 20-200 倍、便宜 40-400 倍,输出 token 免费。社区指出它并非通用语言模型,不能生成自由文本,需预定义输出格式,更适合作为结构化分类器、裁判或路由策略。
Google DeepMind 发布 Gemini 3.8 Live 和 3.8 Live Extended Thinking 两个语音对话模型,前者面向规模与成本效率,后者面向高复杂度任务。
推荐理由:官方给出了两个新模型的定位差异、基准成绩和开放渠道,读者可据此判断它们适合哪些语音智能体场景。
Google DeepMind 和 Google Research 发布 WeatherNext 3,据 Brightband 独立实时评测为目前最先进、最准确的全球天气模型。
推荐理由:原文给出了分辨率、更新频率和降水精度等关键指标,读者可据此判断新一代天气模型的实际能力提升。
Google DeepMind 发布 Gemini 3.8 Flash 与 3.8 Flash Cyber,这是六周内第三个 Flash 版本,定价与 3.7 Flash 相同,为每百万输入 token 0.75 美元、每百万输出 token 3.75 美元。
推荐理由:原文给出新模型在编码、推理和网络安全上的具体基准成绩与定价,读者可据此判断其相对前代和竞品的定位。
Google Research 发布 TimesFM-3,这是其时序基础模型家族的新一代版本,原生预训练用于多变量预测,参数量 3.3 亿,在超过 1 万亿时间点的真实与合成语料上完成预训练。
推荐理由:原文给出了模型架构、参数量、评测排名和开放入口,读者可据此判断它相对单变量模型的提升幅度。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 仅三周,是面向编码和智能体场景的最强工作模型。
推荐理由:官方给出了编码、网页开发与知识工作场景的基准提升和半价定价,读者可据此评估升级价值。
Google DeepMind 发布大规模多语种手语转文本模型 SL2T,首次将手语 AI 带入消费产品,支持在 Pixel 11 的 Gboard 和 Live Transcribe 中实现美国手语(ASL)到英语的听写。模型基于超过 10 万小时、50 多种手语数据训练,在 FLEURS-ASL 基准上取得 70 BLEURT 的零样本成绩,并采用姿态关键点而非原始视频以保护隐私。
推荐理由:原文给出了 SL2T 的训练规模、基准成绩和落地入口,读者可据此判断手语 AI 从实验室走向消费产品的实际进展。
Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,支持视频理解、任务编排和多机器人协作,可将动作执行交给任意底层 VLA 模型。
推荐理由:原文给出了新模型的三大能力升级和公开开放入口,读者可据此判断它如何改变机器人任务编排与多机协作的开发方式。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:Gemini Robotics 2 是最先进的视觉-语言-动作模型(VLA)。
推荐理由:原文给出了三款模型的分工和开放入口,读者可据此判断具身智能模型的能力边界与接入方式。
Google DeepMind 发布三款新 Gemini 模型。Gemini 3.6 Flash 相比 3.5 Flash 减少 17% 输出 token 用量。
推荐理由:官方给出三款新模型的定价、token 效率与关键基准提升,读者可据此评估其在智能体工作流中的成本与性能取舍。
Google DeepMind 发布 Gemini 3.5 Flash Cyber,这是基于 3.5 Flash 微调而成的轻量网络安全模型,用于快速发现、验证和修复软件漏洞。
推荐理由:原文给出了轻量安全模型的定位、基准成绩和内部落地效果,读者可据此判断它在漏洞挖掘场景中的实际价值。
Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、调参和特征工程。模型采用交替行列注意力、行压缩和 ICL 混合架构,完全在数亿个合成数据集上训练,在 TabArena 基准上覆盖 38 个分类和 13 个回归数据集。
推荐理由:原文给出了模型架构、训练方式和在 TabArena 上的评测结果,读者可据此判断零样本表格预测的实际能力。
Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。
推荐理由:原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。
Google DeepMind 发布 Gemma 4 12B,这是其首款支持原生音频输入的中型多模态模型,采用无编码器统一架构,视觉和音频输入直接进入 LLM 主干。
推荐理由:原文给出了架构变化、内存占用和开放入口,读者可据此判断它能否在本地硬件上跑起多模态智能体工作流。
Google DeepMind 发布 Gemini Omni 系列首个模型 Gemini Omni Flash,支持以图像、音频、视频和文本为输入生成高质量视频,并可通过自然语言对话编辑视频。
推荐理由:原文给出了 Omni 系列首个模型的能力范围和开放入口,读者可据此判断它如何把多模态生成带入现有工作流。
Google DeepMind 发布 Gemini 3.5 模型家族,率先推出 3.5 Flash,主打智能体与编码能力,在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超越 Gemini 3.1 Pro,输出速度比其他前沿模型快 4 倍。
推荐理由:官方给出了 3.5 Flash 的基准成绩、速度与成本优势,读者可据此判断它在智能体任务上的实际定位。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先模型的重大升级,通过增强空间推理和多视角理解,让机器人更精准地理解环境。
推荐理由:官方介绍了新模型的推理能力升级与仪表读取新功能,读者可据此判断它在机器人任务中的适用边界。
Google DeepMind 发布 Gemma 4 开源模型家族,号称迄今最智能的开源模型,专为高级推理和智能体工作流设计,以 Apache 2.0 许可发布。
推荐理由:官方发布稿给出了四个尺寸、上下文窗口和硬件适配细节,读者可据此判断在自有硬件上运行与微调的可行性。