Hugging Face Blog·· 27 天前AI 评分42
BenchMIRT:LLM 基准测试究竟在衡量什么?
BenchMIRT: What are LLM benchmarks actually measuring?
AI 导读
Hugging Face 推出 BenchMIRT,一种在单个提示词层面审计 LLM 基准测试的新方法,基于多维项目反应理论(MIRT)分离基准分数背后的不同能力信号。该方法在 100 个 LLM、16 个基准、超 34K 道题上训练,独立恢复了安全与通用推理两个主导维度。分析显示 BBQ 和 WMDP 分数与通用推理关联更强,而 HarmBench 的版权类问题也偏向推理而非安全。
来源:Hugging Face Blog · huggingface.co