BenchMIRT 是什么?
BenchMIRT 是 AI2 推出的一种新方法,用于在单个提示层面审计 LLM 基准测试,通过多维项目反应理论(MIRT)估计模型在安全、通用推理等不同能力上的表现,并分析每个问题主要测量的能力。
(翻译)BenchMIRT:LLM 基准测试究竟在测量什么?

A Blog post by Ai2 on Hugging Face
AI2 推出 BenchMIRT,一种基于多维项目反应理论的新方法,可在单个提示层面审计 LLM 基准测试。研究对 100 个开源模型、16 个基准和超过 3.4 万个问题进行分析,识别出安全与通用推理两个主导维度,并揭示 BBQ、WMDP 等基准实际测量的能力可能与预期不同。
BenchMIRT 是 AI2 推出的一种新方法,用于在单个提示层面审计 LLM 基准测试,通过多维项目反应理论(MIRT)估计模型在安全、通用推理等不同能力上的表现,并分析每个问题主要测量的能力。
它从 16 个基准、100 个模型中独立恢复出安全和通用推理两个主导维度,并发现 BBQ、WMDP 等部分基准的得分更多关联通用推理而非安全,HarmBench 中的不同类型问题也可能测量不同能力。
它可以帮助识别基准中信息量最大的问题,仅用 10% 的问题即可近似保留完整基准对模型能力的评估,还能预测模型在未见过的题目上的表现,准确率达到 79%。
当我怀念旧版 Edge 浏览器时,我在怀念什么?
Building AI to accelerate science and improve lives
场景越多 ≠ 产品越好,:从抽象价值到真实生活的定义结构量子位2026人工智能年度榜单,正式启动!
只会搜关键词还不够,Agent 需要一套更聪明的本地搜索
被用了几千年的铜,怎么突然成了AI时代的新宠?
New insights from Google’s AI & Economy ATLAS被英伟达点名的杭州团队,补上了AI for Science的「最后一公里」
分析师:四大关键因素驱动 Robinhood 链快速增长
当年救了臭氧层的功臣,现在变成了永久性污染物企业案例分享:坤煜量子|36氪2026产业未来大会Mistral 与 Mozilla 合作推出 Firefox Smart Window
号称人类造的最后一个 AI 要来了,刷屏全网的 RSI 是什么
清晰法案投票失败 后续还有机会吗?
苹果Siri AI上线;豆包手机助手消费版正式发布;塔克拉玛干沙漠发现两处大型地下水水源圆桌:探路·产业分工的新图谱,看到新未来——国家力量如何转化为产业价值 | 36氪 2026产业未来大会Mozilla 报告称中国开放权重模型与美国前沿模型仅相差 4.4 个月
飞书与豆包工作合体后首亮相:Agent 能进群,还能帮你写周报、做PPT
Anthropic CEO自爆行业黑幕
缓存不该困在一台服务器里
vivo Buds Clip 体验:42 小时续航的无感佩戴,音质好也舒服
Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking
HTTP 新增 QUERY 方法:有人叫好,也有人质疑“这不就是 GET?”
OpenAI 总裁最新采访:现在所有人对 AI 的预测,大概率都是错的
现在参与以太坊原生质押为什么要先排队一个月?
AMC 炮轰 Robinhood:股票归谁做主?
129亿美元卖身英伟达之后,是时候重新理解Hugging Face了7名博士生仅用3个月从零训练7B大模型:代码+数据+训练日志全公开
GPT Image 2.5 对比实测:变化与局限无问芯穹联合清华、上交正式开源具身端侧推理引擎APXInf,Pi 0.5性能SOTA