微软研究:将物理 AI 推理卸载到边缘或云端可提升机器人性能与续航
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
微软研究团队挑战机器人 AI 的核心假设,系统性研究表明仅在机器人板载 GPU 上运行物理 AI 推理会限制性能、电池寿命和可扩展性,而将推理卸载到边缘或云端 GPU 可带来显著优势。
推荐理由:原文给出首个机器人推理卸载的系统性测量结果,并配套开源工具链,读者可据此评估端侧与边缘云推理的取舍。
NVIDIA 发布 Halos,称其为首个且唯一的物理 AI 全栈安全系统,覆盖硬件、操作系统、端到端模型、仿真验证等各层。面向自动驾驶,Halos 基于 DRIVE AGX Thor 与 Hyperion 平台;面向机器人,基于 IGX Thor 与 Halos Core。
推荐理由:原文梳理了物理 AI 规模化部署所需的安全分层,并给出 NVIDIA Halos 在自动驾驶与机器人两大领域的完整架构与认证进展。
Google DeepMind 发布 Gemini Robotics ER 2,这是其最强大的具身推理模型,支持视频理解、任务编排和多机器人协作,可将动作执行交给任意底层 VLA 模型。
推荐理由:原文给出了新模型的三大能力升级和公开开放入口,读者可据此判断它如何改变机器人任务编排与多机协作的开发方式。
Google DeepMind 发布 Gemini Robotics 2,包含三款模型:Gemini Robotics 2 是最先进的视觉-语言-动作模型(VLA)。
推荐理由:原文给出了三款模型的分工和开放入口,读者可据此判断具身智能模型的能力边界与接入方式。
Hugging Face 发布 Grabette,一套开源、低成本的机器人操作数据采集系统,手持夹爪配合双摄像头即可记录演示并自动生成 LeRobot 格式数据集,无需机器人或实验室。整套硬件与处理管线全部开源,配套 Gripette 机械夹爪用于训练后执行,目标是推动社区共建大规模操作数据集。
推荐理由:原文给出了低成本手持采集方案的全套开源硬件与处理流程,读者可据此判断它能否降低机器人数据采集门槛。
Mistral AI 发布 Robostral Navigate,一个 8B 参数的具身导航模型,仅用单个 RGB 摄像头即可让机器人自主导航,在 R2R-CE 验证 unseen 上取得 76.6% 成功率,超过使用深度或多摄像头的最佳系统 4.5 个点。模型完全在模拟环境中训练,通过指向式导航和在线强化学习(CISPO)持续改进,可运行于轮式、腿式和飞行机器人。
推荐理由:原文给出了单摄像头导航模型在 R2R-CE 上的成绩和训练方法,读者可据此判断它相对多传感器方案的效率优势。
LeRobot v0.6.0 正式发布,旨在闭环机器人学习流程。新版本引入三种世界模型策略(VLA-JEPA、LingBot-VA、FastWAM),新增多个 VLA(GR00T N1.7、MolmoAct2、EO-1、EVO1、Multitask DiT),并推出统一的奖励模型 API(Robometer、TOPReward)。
推荐理由:官方发布 LeRobot v0.6.0,涵盖世界模型、新 VLA、奖励模型、评测基准与部署 CLI,可帮助读者了解开源机器人学习框架的最新能力。
Google DeepMind 宣布启动为期三个月的机器人加速器项目,从欧洲选出 15 家早期机器人初创公司,提供技术指导、AI 工具链及 Gemini 机器人模型支持。入选企业覆盖物流、制造、医疗、气候和导航等领域,包括将机器人焊接参数选择提速 280 倍的 3D-Components、开发脑组织微机器人的 ROBEAUTE 等。项目本周在伦敦启动,旨在推动物理 AI 研究落地为实际应用。
Mistral AI 宣布达成最终协议,收购 Physics AI 公司 Emmi AI,以强化其在工业企业的 AI 转型伙伴地位。Emmi AI 总部位于奥地利,专注于大型工程模型,其 30 多名研究人员和工程师将于 5 月加入 Mistral AI 的科学与应用 AI 团队。
推荐理由:原文给出了收购双方的能力互补和团队去向,读者可据此判断工业AI赛道的最新整合方向。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其推理优先模型的重大升级,通过增强空间推理和多视角理解,让机器人更精准地理解环境。
推荐理由:官方介绍了新模型的推理能力升级与仪表读取新功能,读者可据此判断它在机器人任务中的适用边界。