用作自动化评估系统中裁判的大型语言模型会表现出不一致性,导致结果不可靠。采样温度、模型版本漂移、提示模糊和决胜机制等因素都会导致这种可变性。为缓解这些问题,开发人员可以实施诸如将温度设置为零、固定特定模型版本和提示版本、对多次运行的分数取平均值以及将分数量化为更粗糙的网格等策略。此外,一个重大挑战是立场偏见,即 LLM 裁判倾向于偏爱第一个呈现的答案,这会扭曲评估指标。解决此问题需要以两种呈现顺序运行成对比较,以衡量分歧并确定偏见的程度。 AI
影响 不一致的 LLM 裁判和立场偏见可能导致模型评估不可靠,需要稳健的方法来进行准确的性能评估。
排序理由 该集群讨论了用于提高基于 LLM 的评估系统的可重复性和公平性的研究结果和方法。
- Chatbot Arena
- GPT-4
- Neural Information Processing Systems 2023
- Zheng et al. reply
- claude-latest
- GPT-4o
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →