一篇新的 arXiv 论文研究了用于评判的大型语言模型 (LLM) 的选择如何影响成对比较中的偏好结果。研究发现,LLM 评委自身的模型家族显著影响其判断,引入了一种与被评估候选者质量混淆的偏见。研究人员开发了一种修正估计器来分离这种评委-家族效应,揭示了在 Llama 3.1、Qwen 2.5、Gemma 2 和 Yi 1.5 四个测试模型家族中普遍存在的“同家族提升”现象。研究还发现位置偏见是 LLM 作为评委设置中的另一种失效模式,很大比例的成对结果会根据呈现顺序而反转。 AI
影响 强调了 LLM 评估方法中潜在的偏见,表明未来模型开发需要更强大、更无偏见的评判系统。
排序理由 该集群包含一篇学术论文,详细介绍了关于 LLM 评估的新方法和发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →