一篇新的研究论文强调了在创建用于评估大型语言模型(LLM)作为裁判的合成数据集时存在的一个关键问题。研究表明,为这些数据集生成“幻觉”答案的过程可能会悄无声息地失败,导致结果失真或不准确。这种在多语言语料库中观察到的故障模式导致了裁判准确率的显著下降,并改变了其他测量偏差的大小,而这些偏差无法通过标准的统计检查来检测。该论文为LLM生成的语料库引入了“测试预言机问题”,并提出与那些仅依赖LLM生成的负面示例的语料库不同,通过对正确答案进行确定性扰动构建的语料库提供了一个内置的验证机制。 AI
影响 强调了LLM评估基准可能存在重大不准确性的可能性,需要新的验证协议。
排序理由 学术论文,详细介绍了LLM评估中的新方法和已识别的问题。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →