一项对大规模多任务语言理解 (MMLU) 基准的新审计显示,其总分主要衡量事实检索能力而非推理能力。研究人员使用项目反应理论分析了 1,000 个语言模型中的 14,042 个 MMLU 测试项目,发现该基准混淆了不同的概念,并且 STEM 和非 STEM 分区之间的难度差异很大。这种不平衡无意中偏袒了针对检索进行优化的模型,可能误导了推理密集型任务的模型选择。 AI
影响 强调了当前 LLM 评估的局限性,表明需要更细致的基准来准确评估推理能力。
排序理由 学术论文,分析基准的方法论和发现。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- item response theory
- Massive Multitask Language Understanding
- Science Technology Engineering Mathematics
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →