跳到正文
原文
Ai2 Blog·· 2026-09-01精选AI 评分50

Ai2 提出 BenchMIRT,逐题分析 LLM 评测实际测量的能力

BenchMIRT: What are LLM benchmarks actually measuring?

AI 导读

Ai2 提出 BenchMIRT 方法,基于多维项目反应理论(MIRT)在单条提示词粒度审计 LLM 评测实际测量的能力维度。

推荐理由

原文给出在逐题粒度拆解基准能力信号的审计方法与多基准对照结果,可帮助研究者识别评测分数与底层能力之间的偏差。

来源:Ai2 Blog · allenai.org