跳到正文

#论文/研究

今日 2 条
7月1日周三
  1. Hugging Face Blog62

    IBM 发布 ScarfBench,用于评测 AI 智能体的企业 Java 框架迁移能力

    IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。

    推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。

6月30日周二
6月29日周一
  1. Import AI47

    Import AI 463:自改进机器人、万卡国产 GPU 集群,以及一篇献给人类时代的挽歌

    NVIDIA 推出 ENPIRE 框架,让实体机器人像 AI 智能体一样自主实验、试错与改进,在 PushT 等灵巧操作任务上实现 99% 成功率,但多机器人扩展仍面临基础设施挑战。犹他大学学者发文指出,人类对技术发展的预测历来糟糕,对 AI 影响持过度乐观或悲观态度都缺乏历史依据。

6月27日周六
  1. Google Research60

    Google Research 用冻结多 token 预测加速 Pixel 上的 Gemini Nano 模型

    Google Research 宣布一种新架构,将多 token 预测(MTP)头附加到冻结的 Gemini Nano v3 模型上,以加速 Pixel 9 和 10 系列上的端侧推理。相比独立草稿模型,MTP 在 Pixel 9 上带来 50% 或以上的速度提升,并节省约 130MB 内存,同时保持输出与主模型逐位一致。该方案已用于 AI 通知摘要和校对等功能,减少能耗并提升电池续航。

    推荐理由:原文给出冻结骨干加 MTP 头的端侧加速方案,读者可据此判断其相对独立草稿模型的效率优势。

6月25日周四
  1. Google Research47

    线性弹性缓存如何优化云成本:Google 将页面驱逐建模为滑雪租赁问题

    Google 在 CIDR 论文中提出线性弹性缓存,将页面驱逐建模为滑雪租赁问题,用轻量级机器学习动态调整缓存大小,以最小化缓存总拥有成本。集成到 Spanner 生产环境后,内存使用减少 15.5%,缓存未命中仅增加 5.5%,TCO 降低约 5%,且 I/O 成本影响仅 0.5%。该方法将驱逐策略与“租赁时长”分离,通过浅层决策树预测 TTL,并已在公开缓存轨迹上验证。

  2. Google Research60

    Google Research 揭示推理如何解锁 LLM 参数化知识

    Google Research 在 COLM 2026 发表的论文中,通过受控实验证明允许模型生成推理轨迹能解锁原本无法获取的正确事实答案。研究识别出计算缓冲和事实启动两种互补机制,并发现推理轨迹中若含单个幻觉中间事实会显著降低最终答案正确率。基于此,研究提出在测试时优先保留无幻觉事实的推理轨迹可提升准确率,并建议训练时用过程奖励鼓励事实支持的中间步骤。

    推荐理由:原文用受控实验拆解了推理为何能解锁参数化知识,并给出可落地的训练优化方向。

6月13日周六
  1. Google Research62

    Google Research 发布AI辅助皮肤问题理解研究

    Google Research 发布两项关于AI辅助用户理解皮肤问题的研究。一项发表于 JAMA Dermatology 的量化研究显示,使用AI工具时参与者命名皮肤状况的准确率约为对照组的三倍(23% vs 8%),但确定下一步医疗行动的能力提升不显著。另一项与斯坦福医疗AI团队合作的真实世界研究显示,使用应用后参与者命名状况的能力提升260%,临床医生认为预测与自身评估一致的比例为86%。

    推荐理由:原文给出两项研究的具体数据,读者可据此判断AI辅助皮肤问题识别对用户理解的实际增益与局限。

  2. Google Research62

    加州大学圣迭戈分校计划用 2000 部旧 Pixel 手机搭建低碳云计算平台

    加州大学圣迭戈分校在 Google 支持下,计划将退役 Pixel 手机的主板提取并组成集群,部署一个由 2000 部手机组成的数据中心,为数百名研究人员和学生提供低成本、低碳的云计算服务。早期实验显示,20 部手机组成的集群即可支持 75 人以上班级的峰值提交,延迟低于 AWS 默认后端;该系统预计于 2026 年秋季上线。

    推荐理由:原文给出了旧手机集群的计算能力对比和部署计划,读者可以据此评估这种低碳算力方案的可行性。

6月11日周四
  1. Google Research40

    Google Research 提出机器遗忘审计新框架 Regularized f-Divergence Kernel Tests

    Google Research 在 AISTATS 2026 提出 Regularized f-Divergence Kernel Tests,用于更灵敏、灵活、准确地审计机器学习模型的“遗忘”效果。该框架通过相对距离测试和自适应超参数选择,理论上可控制任意样本量下的假阳性,并随样本增加将假阴性风险收敛至零。实验涵盖合成基准与高能物理数据集 Expo1D 异常检测任务。

6月8日周一
  1. Google DeepMind62

    Google DeepMind 发布塞拉利昂AI辅助学习试验结果

    Google DeepMind 发布在塞拉利昂进行的预注册试验结果,显示使用 Guided Learning 的学生数学成绩比对照组提升 +0.258 个标准差,相当于八周内约 1.2 至 1.7 年的典型学习进步。

    推荐理由:原文给出了预注册试验的量化结果和交互数据,读者可以据此判断AI辅助教学的实际效果与局限。

6月5日周五
  1. Google Research62

    Google 在 Nature 发表论文:用手机前置摄像头实现被动心率监测

    Google Research 在 Nature 发表论文,介绍被动心率监测系统 PHRM,利用手机前置摄像头在面部解锁后拍摄视频,通过深度学习估计心率,MAPE 小于 10%,并估算每日静息心率,MAE 小于 5 bpm,准确度达到可穿戴设备水平。

    推荐理由:原文给出了PHRM系统的技术路线、跨肤色准确率数据和公开数据集,读者可据此评估被动心率监测的可行性与局限。

5月28日周四
  1. Google Research60

    Google 提出零信任聚合方案,为端侧 AI 提供隐私保护分析

    Google 研究团队提出一种零信任聚合方案,用于端侧 AI 的隐私保护分析。该方案结合新型格基密码协议与可信执行环境(TEE),支持单次消息提交,无需设备长时间在线,并确保 Google 只能获得匿名聚合结果。Android SafetyCore 将采用该方案评估安全模型效果,同时保证用户内容仅存于设备端。

    推荐理由:原文给出了一种结合密码学与TEE的多层防护设计,读者可据此理解零信任聚合如何兼顾效率与隐私。

5月27日周三
5月16日周六
  1. Google DeepMind62

    Co-Scientist 助力发现肝纤维化重定位药物

    斯坦福大学遗传学家 Gary Peltz 使用 Google DeepMind 的 Co-Scientist 从现有药物文献中筛选肝纤维化候选药物,在活体人类肝细胞测试中,Co-Scientist 选出的三种候选药有两种能阻断纤维化并促进肝细胞再生,其中抗癌药 vorinostat 阻断了 91% 的损伤反应,而 Peltz 自行挑选的两种药物均未见效果。

    推荐理由:原文呈现了AI智能体在药物重定位中的具体实验结果,读者可据此评估其在该领域的实际价值。

5月8日周五
  1. Berkeley AI Research62

    自适应并行推理:高效推理扩展的下一个范式

    Berkeley AI Research 发布综述,系统梳理自适应并行推理(APR)范式:让模型自行决定何时并行、开多少线程及如何协调,以缓解顺序推理在上下文长度、延迟和计算上的瓶颈。文章对比了 Multiverse、ThreadWeaver、Parallel-R1、NPR 等方法在推理引擎改造、训练奖励设计上的差异,并指出并行化是否在测试时稳定提升准确率仍是开放问题。

    推荐理由:梳理自适应并行推理这一新范式的动机、方法与推理系统实现,并对比各方法的奖励设计与评估取向。

4月30日周四
  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 研究计划,探索医疗AI协作模式

    Google DeepMind 宣布 AI co-clinician 研究计划,探索AI作为护理团队协作成员、在医生临床监督下与患者互动的模式。在98个真实初级保健查询的盲评中,系统在97例中零关键错误,优于两个常用AI系统;在OpenFDA的RxQA开放式药物问答中超越前沿模型。

    推荐理由:原文给出了AI co-clinician在证据综合、药物问答和远程医疗模拟中的具体评测结果,读者可据此判断医疗AI当前的能力边界。

  2. Google Research62

    Google 研究科学家用 ERA 的四种方式:从流行病预测到神经回路

    Google 发布博客介绍其研究科学家使用 Empirical Research Assistance(ERA)的四种方式。ERA 是 Google 在 9 月发布的预印本中提出的工具,用于帮助科学家生成专家级实证软件。

    推荐理由:原文展示了 ERA 在流行病预测、宇宙学、气候监测和神经科学四个领域的实际应用,读者可据此评估 AI 辅助科研工具的落地效果。

4月22日周三
  1. Google DeepMind70

    Google DeepMind 发布 Decoupled DiLoCo 架构,实现跨数据中心低带宽容错训练

    Google DeepMind 发布新论文,提出 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛,通过异步数据流隔离局部故障,使系统在硬件故障时仍能保持高可用性。实测中,该架构用 2-5 Gbps 带宽在四个美国区域成功训练了 120 亿参数模型,速度比传统同步方法快 20 倍以上,并支持混用 TPU v6e 和 TPU v5p 等不同代际硬件。

    推荐理由:原文给出了跨数据中心训练的新架构及其在带宽、容错和硬件混用上的实测结果,读者可据此评估分布式训练的新路径。

  2. Google Research60

    Google Research 提出 ReasoningBank 智能体记忆框架,从成功与失败经验中提炼推理模式

    Google Research 在 ICLR 论文中提出 ReasoningBank,一种从成功和失败经验中提炼高层结构化推理记忆的智能体框架,用于测试时自我进化。

    推荐理由:原文给出了 ReasoningBank 在 WebArena 和 SWE-Bench-Verified 上的成功率与效率提升数据,读者可据此判断该记忆框架的实际收益。

4月20日周一
4月16日周四
  1. Google Research62

    Google 研究提出 Simula 框架,用推理优先方法设计合成数据集

    Google Research 在 TMLR 发表论文,提出推理优先的合成数据生成框架 Simula,将数据生成分解为全局多样化、局部多样化、复杂化和质量检查四个可控轴,并引入基于推理的评测指标。

    推荐理由:原文把合成数据生成重构为机制设计问题,并给出可独立控制的四个轴,读者可据此评估这类方法在生产场景的适用边界。

4月9日周四
4月3日周五
  1. Google Research62

    Google Research 提出评估 LLM 行为倾向对齐的框架

    Google Research 发布论文《Evaluating alignment of behavioral dispositions in LLMs》,提出一个基于心理学问卷和情境判断测试的框架,评估25个LLM在现实场景中的行为倾向与人类共识的对齐程度。

    推荐理由:原文用25个LLM的实测数据展示了模型行为与人类共识之间的两类差距,读者可据此理解当前对齐评估的局限。

4月1日周三
  1. Google Research62

    Google Research 研究:AI 基准评测需要多少标注者才够

    Google Research 发表论文《Forest vs Tree: The (N, K) Trade-off in Reproducible ML Evaluation》,研究可复现机器学习评测中条目数与每条目评分人数之间的权衡。

    推荐理由:原文用真实数据集模拟了标注预算在条目数与每条目评分人数之间的最优分配,读者可据此重新评估自己评测数据的标注策略。

3月31日周二
  1. Google Research75

    Google 发布白皮书:未来量子计算机或能以更少资源破解加密货币加密

    Google Research 发布白皮书,估算未来量子计算机破解保护加密货币的 256 位椭圆曲线离散对数问题(ECDLP-256)所需的量子资源,发现所需量子比特和门数低于此前认知。

    推荐理由:原文给出了量子计算机破解椭圆曲线加密所需资源的最新估算,并说明了零知识证明披露方式,读者可据此评估加密货币迁移到后量子加密的紧迫性。

3月25日周三
  1. Google Research38

    S2Vec:谷歌如何用自监督框架学习城市“语言”

    Google Research 推出 S2Vec,一个用于学习建成环境通用嵌入向量的自监督框架。它通过 S2 Geometry 分区和特征栅格化将地理数据转化为多层图像,再用掩码自编码(MAE)学习位置特征,无需人工标注即可预测人口密度、收入等社会经济指标。评测中,S2Vec 在零样本地理泛化任务上表现最佳,与图像嵌入融合后效果更优。

3月18日周三
3月17日周二
3月13日周五
3月12日周四
  1. Google Research62

    Google Research 发布 AMIE 对话式诊断 AI 真实门诊可行性研究

    Google Research 与 Beth Israel Deaconess 医学中心合作,开展了一项前瞻性单中心可行性研究,在真实门诊场景中部署对话式诊断 AI 系统 AMIE,用于患者就诊前的病史采集。

    推荐理由:原文给出了真实门诊场景下的安全性、诊断准确率和医患体验数据,读者可据此评估对话式医疗 AI 的落地可行性。

1月10日周六
  1. Berkeley AI Research40

    信息驱动式成像系统设计:直接评估与优化成像信息含量

    伯克利AI研究团队提出一种直接基于信息含量评估与优化成像系统的框架,无需训练重建或分类网络。该方法利用成像系统已知的噪声物理特性,仅从含噪测量中估计互信息,并在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证了其预测性能。优化该信息指标可达到与端到端方法相当的设计效果,同时减少内存与计算需求,且无需任务特定的解码器设计。

11月1日周六
  1. Berkeley AI Research62

    Transitive RL:基于分治范式的强化学习算法

    Seohong Park 在 Berkeley AI Research 博客介绍了一种基于分治范式的新型强化学习算法 Transitive RL(TRL),它不依赖时序差分(TD)学习,而是通过递归拆分轨迹来减少 Bellman 递归次数,从而更好地扩展到长程任务。

    推荐理由:原文提出一种不依赖时序差分学习的强化学习新范式,并给出在长程任务上的实验结果,读者可据此评估其可行性。

9月1日周一
  1. Berkeley AI Research38

    word2vec 究竟学到了什么?新理论证明其等价于 PCA 矩阵分解

    一项新研究首次为 word2vec 提供了定量预测理论,证明在现实训练条件下,其学习问题可简化为无权重最小二乘矩阵分解,最终学到的表示由 PCA 给出。从随机小初始化训练时,word2vec 按离散步骤依次学习正交线性子空间,每个特征对应可解释的主题概念,且这些特征可闭式求解为特定矩阵的特征向量。

7月23日周三