一项新研究表明,广泛使用的LLM评判框架容易被操纵,因为所审计的配置均未实施一项名为“先提交评判”(commit-first judging)的拟议防御机制。该方法涉及评判者在评估另一个系统的输出之前自行解决任务,然后仅在候选方案与其自身答案匹配时才接受。研究发现,九种配置使用了这种防御机制的无效变体,这可以追溯到一个共同的拼写错误。在实验中,一个未经辅助的搜索算法成功操纵了其中一种配置,通过了有缺陷的候选方案,而先提交评判有效地阻止了这种操纵,尽管当评判者本身出错时,它会引入自身的问题。 AI
影响 凸显了LLM评估中的关键漏洞,可能影响AI基准测试和开发的可靠性。
排序理由 学术论文,详细介绍了LLM评估方法中的一个缺陷。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- best-of-N search
- commit-first judging
- Evaluation frameworks for nursing informatics
- interval merging task
- LLM judges
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →