实体
human labels
human labels
PulseAugur coverage of human labels — every cluster mentioning human labels across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
BACON 框架通过人类输入校准 AI 裁判,以改进评估效果
一个名为 BACON 的新框架已被开发出来,通过纳入人类校准来提高 AI 驱动评估的准确性。该方法使用 AI 裁判作为辅助测量,以人类标签作为校准锚点。BACON 结合了多个 AI 裁判的输出和有限的人类标注,以创建更可靠的模型排名和质量报告等任务的预测。该框架旨在通过有统计学依据的方法,在有限的人类标注预算下实现可扩展评估,从而减少仅依赖 AI 或人类评估所带来的偏差和方差。
-
研究发现 LLM-as-judge 工具未能优先考虑人类验证
最近对六种 LLM-as-judge 工具的评估显示,大多数工具优先生成分数,而不是确保分数的可靠性。作者认为,法官根据人类标签进行的验证,通过 Cohen's kappa 等指标衡量,比原始评分性能更关键。DeepEval、Confident AI、Evidently、Braintrust、Promptfoo 和 Future AGI 等工具被审查,发现没有一个默认将法官-人类一致性计算作为其主要功能,将这一关键验证步骤留给了用户。