跳到正文

全部动态

今日 48 条
7月7日周二
  1. Hugging Face Blog78

    LeRobot v0.6.0 发布:引入世界模型、新 VLA 与统一评测基准

    LeRobot v0.6.0 正式发布,旨在闭环机器人学习流程。新版本引入三种世界模型策略(VLA-JEPA、LingBot-VA、FastWAM),新增多个 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),并推出统一的奖励模型 API(Robometer、TOPReward)。

    推荐理由:官方发布 LeRobot v0.6.0,涵盖世界模型、新 VLA、奖励模型、评测基准与部署 CLI,可帮助读者了解开源机器人学习框架的最新能力。

  2. Hugging Face Blog78

    SkyPilot 与 Hugging Face 联合推出零出口流量存储,跨云训练直接挂载 Hub 数据

    SkyPilot 与 Hugging Face 联合推出 store: hf 后端,用一条 hf:// URL 和现有 HF_TOKEN 即可把 Hugging Face Bucket 或任意 Hub 仓库挂载进 SkyPilot 任务,在 20+ 云、Kubernetes、Slurm 和本地集群上运行。

    推荐理由:原文给出了 hf:// 挂载、零出口流量和 Xet 去重的具体机制与实测数字,读者可据此判断跨云训练的数据成本能省多少。

7月6日周一
  1. Hugging Face Blog62

    Photoroom 详解 PRX 图像模型的数据策略:从数据源到去重过滤的完整管线

    Photoroom 发布 PRX 系列第四篇博客,详解其图像生成模型 PRX 的预训练数据策略。数据管线混合公开与内部数据集,用 VLM 重写长标题,以 Lance 构建、MDS 流式训练,并采用 JPEG 质量 92 存储、感知哈希去重和基于标题的轻量过滤。作者对比了多个标题生成模型,最终选用 Qwen3-VL-8B,并分享了碎片化、跳过列表等工程经验。

    推荐理由:Photoroom 公开了 PRX 图像模型预训练数据管线的完整设计,从数据源、重写标题到去重过滤,读者可据此复现或改进自己的数据流程。

  2. Hugging Face Blog62

    Hugging Face 重构 Kernels 项目:新增内核仓库类型、代码签名与智能体开发支持

    Hugging Face 发布 Kernels 项目重大更新,在 Hub 上引入新的 kernel 仓库类型,并默认只加载受信任发布者的内核,同时加入基于 Sigstore cosign 的代码签名机制。

    推荐理由:原文梳理了内核仓库类型、签名验证和 CLI 重构等关键变化,读者可据此判断新内核工作流的安全边界与适配范围。

7月3日周五
7月2日周四
  1. Mistral AI82

    Mistral 发布 Leanstral 1.5,6B 激活参数开源模型在形式化验证上刷新多项基准

    Mistral 发布 Leanstral 1.5,一款 Apache-2.0 许可、总参数 119B 但仅 6B 激活的开源模型,在 miniF2F 上达到 100%,解决 PutnamBench 587/672 题,并在 FATE-H(87%)和 FATE-X(34%)上取得新 SOTA。

    推荐理由:原文给出了基准成绩、成本对比和真实代码库找 bug 的案例,读者可据此判断它在形式化验证上的实用程度。

7月1日周三
  1. Hugging Face Blog60

    Hugging Face 与 Cerebras 联手推出实时语音 AI 演示

    Hugging Face 与 Cerebras 合作推出实时语音 AI 演示,构建了全开源的级联式语音到语音流水线:语音输入经 Nvidia Parakeet 识别,由 Cerebras 上的 Gemma 4 31B 处理,再经阿里 Qwen3TTS 合成语音输出。该流水线已驱动超过 9,000 台 Reachy Mini 机器人,旨在通过低延迟和稳定推理改善对话的自然感。

    推荐理由:原文展示了开源语音流水线与 Cerebras 推理速度结合后的实时对话体验,读者可据此评估端到端语音方案的延迟表现。

  2. Hugging Face Blog62

    IBM 发布 ScarfBench,用于评测 AI 智能体的企业 Java 框架迁移能力

    IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。

    推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。

  3. Google Research62

    Google Research 发布 50+ 城市建筑级屋顶反照率数据集及 Heat Resilience Earth Engine App

    Google Research 发布覆盖 50+ 城市、9 个国家的建筑级屋顶反照率数据集,并上线 Heat Resilience Earth Engine App 供公众使用。

    推荐理由:原文给出了数据覆盖范围、精度验证和开放入口,读者可以据此判断这类建筑级反照率数据对城市热缓解规划的实际可用性。

6月30日周二
  1. Google Research77

    Google 发布 TabFM:面向表格数据的零样本基础模型

    Google Research 发布 TabFM,一个面向表格数据分类与回归的零样本基础模型,将表格预测重构为上下文学习问题,无需手动训练、调参和特征工程。模型采用交替行列注意力、行压缩和 ICL 混合架构,完全在数亿个合成数据集上训练,在 TabArena 基准上覆盖 38 个分类和 13 个回归数据集。

    推荐理由:原文给出了模型架构、训练方式和在 TabArena 上的评测结果,读者可据此判断零样本表格预测的实际能力。

6月29日周一
  1. Import AI47

    Import AI 463:自改进机器人、万卡国产 GPU 集群,以及一篇献给人类时代的挽歌

    NVIDIA 推出 ENPIRE 框架,让实体机器人像 AI 智能体一样自主实验、试错与改进,在 PushT 等灵巧操作任务上实现 99% 成功率,但多机器人扩展仍面临基础设施挑战。犹他大学学者发文指出,人类对技术发展的预测历来糟糕,对 AI 影响持过度乐观或悲观态度都缺乏历史依据。

6月27日周六
  1. Google Research60

    Google Research 用冻结多 token 预测加速 Pixel 上的 Gemini Nano 模型

    Google Research 宣布一种新架构,将多 token 预测(MTP)头附加到冻结的 Gemini Nano v3 模型上,以加速 Pixel 9 和 10 系列上的端侧推理。相比独立草稿模型,MTP 在 Pixel 9 上带来 50% 或以上的速度提升,并节省约 130MB 内存,同时保持输出与主模型逐位一致。该方案已用于 AI 通知摘要和校对等功能,减少能耗并提升电池续航。

    推荐理由:原文给出冻结骨干加 MTP 头的端侧加速方案,读者可据此判断其相对独立草稿模型的效率优势。

6月25日周四
  1. Google Research47

    线性弹性缓存如何优化云成本:Google 将页面驱逐建模为滑雪租赁问题

    Google 在 CIDR 论文中提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,用轻量级机器学习动态调整缓存大小,以最小化缓存总拥有成本。集成到 Spanner 生产环境后,内存使用减少 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,且 I/O 成本影响仅 0.5%。该方法将驱逐策略与“租赁时长”分离,通过浅层决策树预测 TTL,并已在公开缓存轨迹上验证。

  2. Google Research60

    Google Research 揭示推理如何解锁 LLM 参数化知识

    Google Research 在 COLM 2026 发表的论文中,通过受控实验证明允许模型生成推理轨迹能解锁原本无法获取的正确事实答案。研究识别出计算缓冲和事实启动两种互补机制,并发现推理轨迹中若含单个幻觉中间事实会显著降低最终答案正确率。基于此,研究提出在测试时优先保留无幻觉事实的推理轨迹可提升准确率,并建议训练时用过程奖励鼓励事实支持的中间步骤。

    推荐理由:原文用受控实验拆解了推理为何能解锁参数化知识,并给出可落地的训练优化方向。

  3. Google DeepMind78

    Gemini 3.5 Flash 内置计算机使用能力,支持跨平台智能体构建

    Google DeepMind 宣布计算机使用现已成为 Gemini 3.5 Flash 的内置工具,开发者可通过 Gemini API 和 Gemini Enterprise Agent Platform 构建能跨浏览器、移动端和桌面端看、推理并行动的智能体。

    推荐理由:原文说明了计算机使用能力从独立模型并入主模型后的性能提升与安全机制,读者可据此评估企业自动化场景的适用性。

  4. 巨潮公告 · 算力集群10

    亚信安全子公司拟与关联方西云算力签订算力集群服务框架协议

    亚信安全控股子公司亚信科技拟与关联方宁夏西云算力签订《算力集群服务框架协议》,采购高性能GPU及存储算力资源及配套部署运维服务,协议金额上限3,000万元,有效期1年。该交易构成关联交易,已获董事会审议通过,无需提交股东会审议。公司提示,采购尚处投资建设阶段,若下游客户预算收缩或私有化模型落地不及预期,项目订单拓展及投资回报周期存在不确定性。

6月24日周三
  1. Mistral AI62

    Mistral 发布连接器新管理能力,支持多账户与调试器

    Mistral 为 Connectors 推出多项新能力:增强的管理控制(GA)可按工作区或组织设置连接器访问并逐工具开关,带连接器作用域的 API 密钥(GA)防止自动化 AI 工作负载中的身份冒充,多账户连接器(GA)允许一个连接器绑定多个账户。

    推荐理由:原文给出了连接器在权限、身份、调试和 Agent 工作流上的具体能力变化,读者可据此评估企业级接入的落地方式。

6月23日周二
  1. Mistral AI62

    Mistral 发布 OCR 4 文档解析模型

    Mistral 发布 OCR 4,在提取文本之外新增边界框、块分类和逐页逐词置信度分数,支持 170 种语言,可在单容器内自托管部署。API 定价为每 1000 页 4 美元,Batch API 折扣后 2 美元,Document AI 为 5 美元。独立标注者在人类偏好评测中更倾向于 OCR 4,平均胜率 72%,OlmOCRBench 得分 85.20。

    推荐理由:原文给出了新模型在结构化输出、多语言覆盖和自托管方面的能力变化,读者可据此判断它如何接入现有文档处理流程。

6月22日周一
6月17日周三
  1. Google DeepMind62

    Google DeepMind 与英国政府合作开发 AI 规划审批原型,目标将审批时间减半

    Google DeepMind 与英国政府合作开发基于 Gemini 的 AI 规划审批原型,目标是将房主规划申请的处理时间缩短 50%。该工具可整合数据、识别当地政策、总结反馈并起草评估报告,规划官员仍保留最终决策权。早期试点在 Barnet、Camden 和 Dorset 进行,政府计划 2027 年起向全国所有议会开放。

    推荐理由:原文给出了原型工具的功能范围和落地时间表,读者可以据此判断 AI 辅助政务审批的实际路径。

  2. Google Research52

    Google 发布英国细粒度生态特征向量化数据集

    Google Research 发布向量化数据集,将英格兰的树篱、石墙和小林地等细粒度生态特征从像素地图转化为可操作的清单,供土地所有者与保护机构测量和扩展这些特征。该数据集基于预训练于 3 亿张卫星图像的 ViT 模型微调,并用 Polsby-Popper 紧致度评分对几何形状分类,通过 Google Earth Engine 并行处理覆盖超 13 万平方公里的区域。

6月16日周二
  1. Google DeepMind62

    Google DeepMind 发布 AI Control Roadmap,以系统级安全守护内部智能体

    Google DeepMind 发布 AI Control Roadmap,在传统对齐之外增加系统级安全层,将内部智能体视为潜在未对齐对象,通过威胁建模、监督与分级响应提供保障。团队已分析百万条编码智能体轨迹,并据此为 Gemini Spark 智能体构建实时监控,多数标记事件源于智能体误解而非恶意意图。

    推荐理由:原文给出了威胁建模、分级响应和百万轨迹实测,读者可据此理解系统级安全如何补足对齐的局限。

6月15日周一
6月13日周六
  1. Google Research62

    Google Research 发布AI辅助皮肤问题理解研究

    Google Research 发布两项关于AI辅助用户理解皮肤问题的研究。一项发表于 JAMA Dermatology 的量化研究显示,使用AI工具时参与者命名皮肤状况的准确率约为对照组的三倍(23% vs 8%),但确定下一步医疗行动的能力提升不显著。另一项与斯坦福医疗AI团队合作的真实世界研究显示,使用应用后参与者命名状况的能力提升260%,临床医生认为预测与自身评估一致的比例为86%。

    推荐理由:原文给出两项研究的具体数据,读者可据此判断AI辅助皮肤问题识别对用户理解的实际增益与局限。

  2. Google Research62

    加州大学圣迭戈分校计划用 2000 部旧 Pixel 手机搭建低碳云计算平台

    加州大学圣迭戈分校在 Google 支持下,计划将退役 Pixel 手机的主板提取并组成集群,部署一个由 2000 部手机组成的数据中心,为数百名研究人员和学生提供低成本、低碳的云计算服务。早期实验显示,20 部手机组成的集群即可支持 75 人以上班级的峰值提交,延迟低于 AWS 默认后端;该系统预计于 2026 年秋季上线。

    推荐理由:原文给出了旧手机集群的计算能力对比和部署计划,读者可以据此评估这种低碳算力方案的可行性。

6月11日周四
  1. Google Research40

    Google Research 提出机器遗忘审计新框架 Regularized f-Divergence Kernel Tests

    Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于更灵敏、灵活、准确地审计机器学习模型的“遗忘”效果。该框架通过相对距离测试和自适应超参数选择,理论上可控制任意样本量下的假阳性,并随样本增加将假阴性风险收敛至零。实验涵盖合成基准与高能物理数据集 Expo1D 异常检测任务。

  2. Google DeepMind79

    Google DeepMind 发布开源扩散模型 DiffusionGemma,推理速度最高提升 4 倍

    Google DeepMind 发布实验性开源模型 DiffusionGemma,采用文本扩散技术并行生成整块文本,在专用 GPU 上推理速度最高提升 4 倍,单张 NVIDIA H100 上每秒可生成 1000+ token。该 26B MoE 模型推理时仅激活 3.8B 参数,量化后适配 18GB 显存,面向内联编辑、代码填充等速度敏感的本地交互场景,但整体输出质量低于标准 Gemma 4。

    推荐理由:原文给出了速度提升、硬件门槛和适用场景,读者可据此判断它适合哪些本地交互工作流。

6月10日周三
6月9日周二
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.5 Live Translate 语音翻译模型

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是最新的音频模型,支持 70 多种语言的近实时语音到语音翻译,能保留说话者的语调、节奏和音高,并连续生成语音而非逐轮等待。

    推荐理由:原文给出了新模型的连续语音翻译能力、覆盖语言数和各产品入口,读者可据此判断它如何改变跨语言实时沟通。

  2. Google DeepMind28

    Google DeepMind 加速器选拔 15 家欧洲机器人初创公司

    Google DeepMind 宣布启动为期三个月的机器人加速器项目,从欧洲选出 15 家早期机器人初创公司,提供技术指导、AI 工具链及 Gemini 机器人模型支持。入选企业覆盖物流、制造、医疗、气候和导航等领域,包括将机器人焊接参数选择提速 280 倍的 3D-Components、开发脑组织微机器人的 ROBEAUTE 等。项目本周在伦敦启动,旨在推动物理 AI 研究落地为实际应用。

6月8日周一
  1. Google DeepMind62

    Google DeepMind 发布塞拉利昂AI辅助学习试验结果

    Google DeepMind 发布在塞拉利昂进行的预注册试验结果,显示使用 Guided Learning 的学生数学成绩比对照组提升 +0.258 个标准差,相当于八周内约 1.2 至 1.7 年的典型学习进步。

    推荐理由:原文给出了预注册试验的量化结果和交互数据,读者可以据此判断AI辅助教学的实际效果与局限。