PulseAugur
实时 03:31:31
English(EN) Adding a Third Kind of Judge: What Cross-LLM Evaluation Changed About the Winner

通过跨模型评判和加权评分增强 LLM 评估

本文详细介绍了一种评估大型语言模型(LLM)的新方法,引入了第三种裁判:LLM 本身,它们互相评分对方的输出。作者之前发现 Gemini 错误地将算术标记为幻觉,促使测试以查看这是否是普遍的 LLM 裁判问题。通过让 Claude Sonnet 4.5 评分 GPT-5.5 的输出,反之亦然,评估现在包括一个“交叉裁判”分数。这个新分数与人类和 Gemini 的分数一起加权,其中人类判断占最大权重(50%),以创建一个综合分数,旨在提供对模型性能更可靠的评估,特别是在事实准确性和推理方面。 AI

影响 这种跨 LLM 的评估方法可能导致更强大、更可靠的基准来评估模型能力,从而影响未来的模型开发和选择。

排序理由 该项目描述了一种新颖的 LLM 评估方法,包括一种新的评分方法以及使用 LLM 互相作为裁判。[lever_c_demoted from research: ic=1 ai=1.0]

在 dev.to — LLM tag 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

通过跨模型评判和加权评分增强 LLM 评估

报道来源 [1]

  1. dev.to — LLM tag TIER_1 English(EN) · K Gann ·

    增加第三类裁判:跨LLM评估如何改变了获胜者

    <p><em>Part 3 of a series on auto-grooming Jira backlogs with ML and LLMs. <a href="https://dev.to/jubilee_happy_a567008f769/how-i-auto-groomed-500-jira-tickets-with-ml-and-llm-1j7k">Read Part 1</a> and <a href="https://dev.to/jubilee_happy_a567008f769/judging-the-judges-what-hap…