实体
Confident AI
Confident AI
PulseAugur coverage of Confident AI — every cluster mentioning Confident AI across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
研究发现 LLM-as-judge 工具未能优先考虑人类验证
最近对六种 LLM-as-judge 工具的评估显示,大多数工具优先生成分数,而不是确保分数的可靠性。作者认为,法官根据人类标签进行的验证,通过 Cohen's kappa 等指标衡量,比原始评分性能更关键。DeepEval、Confident AI、Evidently、Braintrust、Promptfoo 和 Future AGI 等工具被审查,发现没有一个默认将法官-人类一致性计算作为其主要功能,将这一关键验证步骤留给了用户。
-
语音代理测试在罕见输入时失败;模拟是关键
使用真实通话记录测试语音代理可能会产生虚假的安全感,因为它无法捕捉罕见或新颖的用户行为。一名开发者在遇到一名呼叫者在句子中间切换语言时遇到了严重故障,而这种模式在他的大量过往生产通话测试集中并不存在。为解决此问题,团队转向模拟对抗性呼叫者画像,发现虽然各种工具可以执行这些模拟,但有效性取决于明确定义的画像,而不是具体的测试平台。