一篇新的研究论文探讨了当大型语言模型(LLMs)被用作裁判时,它们在信任和真相判断之间的可分离性。研究发现,与人类相比,LLM裁判倾向于将信任评分与真实性混淆,这表明这些判断不像通常假设的那样独立。当信息来源被操纵时,LLM裁判会同时改变其信任评分和真相判断,这表明它们容易受到外部线索的影响,而不是纯粹的事实评估。 AI
影响 研究结果表明,当前的LLM作为裁判的协议可能需要改进,以确保对真实性的独立评估。
排序理由 在arXiv上发表的研究论文,详细介绍了关于LLM作为裁判系统的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →