AI工具AI评分 一般 (53)AI 中文改写

BenchMIRT:大语言模型基准测试究竟在测什么?

20 小时前 1 阅读来源:HuggingFace Blog

AI 中文改写

原文为英文,由 AI 改写为中文报道,内容完整。如需参考原文请点击下方链接

大模型评测圈最近迎来一个值得关注的新工具:AI2(艾伦人工智能研究所)发布了一款名为 BenchMIRT 的基准测试审计方法,专门用来拆解那些看似“全能”的LLM基准测试到底在考模型什么能力。简单说,以前我们看一个基准分数,比如某个模型在MMLU-Pro上拿了80分,只能笼统说它“推理不错”,但BenchMIRT能告诉你这80分里有多少是纯推理贡献的,有多少其实靠的是其他能力,甚至可能跟基准设计的初衷南辕北辙。 这件事的背景是,当前业界对LLM的评估越来越依赖各种基准测试,但基准本身的设计存在一个隐蔽问题:一个基准名义上测的是某种能力,比如安全性或推理能力,但里面的具体题目往往掺杂了多种能力需求。举个例子,BBQ基准本意是测试模型是否依赖社会刻板印象,但其中一道关于孙子和爷爷叫Uber的题,既要考察年龄偏见,又要求模型理清人物关系并从证据推理,这显然超出了单一“偏见”范畴。更麻烦的是,像WildJailbreak这种基准,既有恶意越狱提示词,也有测试模型是否过度拒绝的良性提示词,前者跟安全强相关,后者却更依赖通用推理,把两类题混在一起算平均分,就会掩盖真实信号。BenchMIRT的价值就在于,它用多维项目反应理论(MIRT)从模型和题目两个层面拆解这些混杂信号,让研究者看清分数背后的真实驱动力。 从实际结果看,BenchMIRT的训练数据覆盖了100个LLM在16个基准上的表现,涉及超过3.4万道题,其中6个基准测通用推理(如MMLU-Pro、GPQA、MATH、BBH),10个来自AI2的Olmo 3安全套件(如HarmBench、StrongReject、WildJailbreak、BBQ、WMDP、XSTest)。研究者没有预先告诉模型哪些基准测什么能力,但BenchMIRT独立恢复出了两个主导维度:安全和通用推理,而且重复分析结果稳定。这带来一个对中国卖家和AI从业者很实际的启示:如果你在选型或调优模型时只看单一基准分数,很可能被误导。比如BBQ虽然常被归为安全基准,但BenchMIRT分析显示它跟通用推理的关联更强,这意味着一个模型BBQ得分低,可能不是因为它有偏见,而是推理能力不足。对于做跨境电商客服、内容审核或合规风控的团队来说,这意味着评估模型时不能迷信某个榜单总分,得拆开看具体能力维度,否则可能选错模型或误判风险。BenchMIRT的开源代码和数据都已公开,有技术能力的团队可以直接拿来自建评估体系,这比盲目跟风刷榜要靠谱得多。

以上为 AI 中文改写版本,如需查看英文原文请访问

英文原文 · HuggingFace Blog

内容版权归原作者及 HuggingFace Blog 所有

这篇文章对你有帮助吗?
觉得有用?分享给更多人

留言 · 0

暂无留言,来说两句吧

留言经合规过滤后展示,禁止违法内容