本文详细介绍了一种评估大型语言模型(LLM)的新方法,引入了第三种裁判:LLM 本身,它们互相评分对方的输出。作者之前发现 Gemini 错误地将算术标记为幻觉,促使测试以查看这是否是普遍的 LLM 裁判问题。通过让 Claude Sonnet 4.5 评分 GPT-5.5 的输出,反之亦然,评估现在包括一个“交叉裁判”分数。这个新分数与人类和 Gemini 的分数一起加权,其中人类判断占最大权重(50%),以创建一个综合分数,旨在提供对模型性能更可靠的评估,特别是在事实准确性和推理方面。 AI
影响 这种跨 LLM 的评估方法可能导致更强大、更可靠的基准来评估模型能力,从而影响未来的模型开发和选择。
排序理由 该项目描述了一种新颖的 LLM 评估方法,包括一种新的评分方法以及使用 LLM 互相作为裁判。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →