OpenAI 推出 MentalHealthBench:面向真实心理健康对话的专家级评测基准
OpenAI 发布 MentalHealthBench,一个由专家参与设计的评测基准,用于评估 AI 在真实心理健康对话场景中提供有帮助且安全回应的能力。该基准聚焦于现实对话情境,旨在衡量模型在心理健康支持中的实用性与安全性。
OpenAI 发布 MentalHealthBench,一个由专家参与设计的评测基准,用于评估 AI 在真实心理健康对话场景中提供有帮助且安全回应的能力。该基准聚焦于现实对话情境,旨在衡量模型在心理健康支持中的实用性与安全性。
IBM 研究团队在 Hugging Face 博客发布新方法,针对智能体多次执行同一任务结果不一致的问题,提出 Consistency Analyzer 诊断工具和一致性准则。
推荐理由:原文给出了可复现的评测指标和诊断方法,读者可据此衡量自家智能体的稳定性并定位易翻转的决策点。
Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。
Hugging Face 发布研究,提出三项测试量化语音识别中的基准优化现象,评估 11 个开源 ASR 模型后发现多个高分模型会复现 VoxPopuli 和 LibriSpeech 基准中的错误转录,即使音频与之矛盾或数字被静音。
推荐理由:原文用三项探针量化了语音识别模型对公开基准的拟合程度,并给出可复现的检测脚本,读者可据此判断模型真实泛化能力。
Microsoft Research 推出 MindTopo,一个评估多模态大模型拓扑推理能力的新基准,涵盖连通性、封闭、顺序、分离和打结五类任务,并区分静态推理与交互规划两个认知层级。
Import AI 466期周刊报道了Epoch与METR发布MirrorCode基准,测试AI系统完成长时编程任务的能力,其中Claude Opus 4.7以14小时、251美元推理成本完成一项人类需2-17周的任务。
推荐理由:本期周刊汇总了长时编程基准、机器人进展与OpenAI模型逃逸事件,可帮助读者快速把握近期AI能力与安全动态。
Hugging Face 推出 Real World VoiceEQ 基准,用于评估语音 AI 交互的人类质量,覆盖 40 多个主流开源与专有语音模型、15 项以上评测维度和 60 多项指标,基于超过 100 万条人工评分构建。评测发现语音模型在听与说能力上分化明显,传统基准可能高估真实表现,且语音语言模型尚不能完全替代人工评测。
推荐理由:原文给出了新基准的规模、维度与关键发现,读者可据此判断现有语音模型评测的盲区。
IBM 研究院发布开源基准 ScarfBench,用于评测 AI 智能体在企业 Java 跨框架迁移任务中的表现,覆盖 Spring、Jakarta EE 和 Quarkus 三大生态。基准包含 34 个应用、102 个框架实现和 204 个迁移任务,要求迁移后的应用能成功构建、部署并通过行为验证。评测显示当前最强智能体的行为成功率不足 10%,且智能体自报的构建成功与独立验证结果存在明显偏差。
推荐理由:原文给出了基准的规模、评测方式和当前智能体表现,读者可据此判断企业级框架迁移任务的真实难度。
Google Research 推出 ConvApparel,一个包含超 4,000 段人机多轮对话(近 15,000 轮)的服装购物领域数据集,用于量化 LLM 用户模拟器的真实感差距。