最近对六种 LLM-as-judge 工具的评估显示,大多数工具优先生成分数,而不是确保分数的可靠性。作者认为,法官根据人类标签进行的验证,通过 Cohen's kappa 等指标衡量,比原始评分性能更关键。DeepEval、Confident AI、Evidently、Braintrust、Promptfoo 和 Future AGI 等工具被审查,发现没有一个默认将法官-人类一致性计算作为其主要功能,将这一关键验证步骤留给了用户。 AI
影响 突出了 LLM 评估工具中的一个关键差距,强调了在简单评分之上进行稳健的人类一致性验证的必要性。
排序理由 该项目是 LLM-as-judge 领域内多个工具的比较评估,侧重于方法和验证。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →