BenchMIRT:LLM基准测试到底在测什么?
深度Hugging Face2026年9月1日6 分钟阅读

一个基准通常被设计来衡量特定能力,但内部的任务可能依赖不止一个目标。Ai2 发布 BenchMIRT,用多维项目反应理论逐题审计基准,发现 BBQ 更接近推理、WMDP 关联推理却反向相关,并可用 10% 的题目近似全量评估。
本文编译自 BenchMIRT: What are LLM benchmarks actually measuring?,版权归原作者所有。
觉得有用?分享给更多人