一篇新论文介绍了一种封闭形式的估计器,旨在解决在使用外部参考集(锚点)时 LLM 评判面板中的误差相关性问题。该研究侧重于锚点本身可能被评判者共享误差污染的场景,这是一种常见的假设违反。所提出的方法即使在锚点不完全干净的情况下,也能估计质量方差、共模方差和锚点污染相关性。该估计器附带一个诊断电池,用于评估模型充分性并识别潜在偏差。 AI
影响 提供了一种评估 LLM 输出的新统计方法,有望提高基准测试结果的可靠性。
排序理由 该集群包含一篇发表在 arXiv 上的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →