human labels
PulseAugur coverage of human labels — every cluster mentioning human labels across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
校准LLM评估套件,以区分真实变化与噪声
本文介绍了一种校准提示评估套件噪声基底的方法,认为许多团队追求的微小改进会淹没在采样噪声中。提出的三部分评估套件包括用于确定噪声基底的A/A研究、针对人类标签的评分者校准以及用于在变化超过既定阈值时发出信号的警报门控。通过对评估套件自身进行运行,开发人员可以建立最小可检测效应,确保观察到的变化具有统计学意义,而不仅仅是随机方差。
-
研究发现任务分解对基于大语言模型的自然语言生成评估无效
一项新的研究论文对使用“大语言模型即评委”框架的任务分解在改进自然语言生成(NLG)评估方面的有效性提出了质疑。研究发现,与不进行分解的基线相比,分解并未带来性能提升。相反,先前观察到的改进被归因于使用人类标签进行训练,而非分解方法本身。研究还表明,“大语言模型即评委”在用人类标签训练后,其性能可与人类标注员相媲美。
-
BACON 框架通过人类输入校准 AI 裁判,以改进评估效果
一个名为 BACON 的新框架已被开发出来,通过纳入人类校准来提高 AI 驱动评估的准确性。该方法使用 AI 裁判作为辅助测量,以人类标签作为校准锚点。BACON 结合了多个 AI 裁判的输出和有限的人类标注,以创建更可靠的模型排名和质量报告等任务的预测。该框架旨在通过有统计学依据的方法,在有限的人类标注预算下实现可扩展评估,从而减少仅依赖 AI 或人类评估所带来的偏差和方差。
-
研究发现 LLM-as-judge 工具未能优先考虑人类验证
最近对六种 LLM-as-judge 工具的评估显示,大多数工具优先生成分数,而不是确保分数的可靠性。作者认为,法官根据人类标签进行的验证,通过 Cohen's kappa 等指标衡量,比原始评分性能更关键。DeepEval、Confident AI、Evidently、Braintrust、Promptfoo 和 Future AGI 等工具被审查,发现没有一个默认将法官-人类一致性计算作为其主要功能,将这一关键验证步骤留给了用户。