一项研究发现,用作裁判的大型语言模型(LLM)表现出位置偏见,这意味着它们倾向于偏爱列表中较早出现的回复,而与回复的实际质量无关。即使在LLM没有收到标签或关于如何对回复进行排名的明确指示的情况下,也观察到了这种偏见。研究表明,仅仅使用像GPT-4或Gemini这样更大或更先进的模型并不能从根本上解决这种位置偏见,这表明在依赖LLM进行客观评估方面存在根本性挑战。 AI
影响 突出了基于LLM的评估系统中潜在的缺陷,表明需要超越简单地扩大模型规模的更稳健的方法。
排序理由 该集群讨论了一篇分析LLM行为的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →