研究人员开发了 HLE-Verified,这是 Humanity's Last Exam (HLE) 基准的一个修订版本,旨在解决有关噪声数据和有偏评估的担忧。新基准采用两阶段验证和修复过程,包括专家审查和基于模型的交叉检查,以确保准确性。在测试最先进的语言模型时,HLE-Verified 显示平均准确率提高了 7-10 个百分点,在包含原始问题陈述或答案错误的条目上有了显著改进。 AI
影响 通过减少基准数据集中的噪声和错误,提高了 LLM 评估的可靠性。
排序理由 该条目是一篇研究论文,详细介绍了用于评估 LLM 的新基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →