实体
Verdict
Verdict
PulseAugur coverage of Verdict — every cluster mentioning Verdict across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天
2 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
AI代理陷入幻觉循环,浪费470次生成
一家运行多个AI代理的公司发现了一个重大问题,其中一个审稿代理因幻觉要求而反复拒绝制片人代理的工作。这是因为审稿代理没有收到原始请求,导致它编造了“仅输出3行”等标准,这与制片人代理至少600个字符的合同相冲突。该系统的重试机制未能打破循环,导致约470次AI生成被浪费。该公司此后实施了修复措施,包括将原始请求传递给审稿员、声明文档截断以及在连续失败一定次数后增加人工审查。
-
新基准和方法增强多模态AI推理和可信度 · 跟踪4个来源
研究人员正在开发新方法来提高多模态大语言模型(MLLMs)的可靠性和可信度。一种方法VERDICT利用多个验证器之间的分歧来识别推理步骤中的错误,而无需额外的训练数据。另一种方法AD2-Bench引入了一个分层诊断框架,以查明证据获取中的失败,区分空间歧义和语义不确定性。此外,StructReward提供了一个高效的框架,通过提供结构化的、步骤级别的奖励来实现多模态推理的自我纠正,降低了强化学习的计算开销。最后,MMArch提供了一个…