一篇新的研究论文系统地评估了大型语言模型(LLM)在用于序数分类任务时的位置偏差。研究发现,所有测试的十个前沿 LLM 都对标签顺序、演示顺序和演示放置敏感,表明这是一个普遍存在的问题。虽然改变提示、任务和模型因素表明较低的尺度基数可以提高准确性和稳定性,但测试的去偏方法并未提供可靠的解决方案。基于比较的列表式表述显示出希望,但在不同模型和偏差来源上的有效性各不相同,这表明位置鲁棒性取决于整个系统配置,而不仅仅是模型本身。 AI
影响 强调了 LLM 推理中的一个关键漏洞,该漏洞可能会影响需要有序输出的应用程序,因此需要仔细的系统设计以实现鲁棒性。
排序理由 该集群包含一篇详细介绍 LLM 行为的系统性实验和发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →