PulseAugur
实时 08:39:20
English(EN) Wrong but Useful: Trajectory Value Beyond Answer Correctness in Multi-Agent Messages

新协议衡量AI消息的“轨迹价值”,超越答案正确性

研究人员开发了一种名为“多样化假设审议”(DHD)的新协议,用于评估多智能体推理系统中消息的价值,即使这些消息包含不正确的答案。DHD协议通过评估消息的包含是否帮助或损害了后续推理,独立于其最终答案的正确性来衡量消息的“轨迹价值”。使用GPT-OSS 120B和Gemma 4-31B-it模型在各种基准测试上的实验表明,“错误但有用”的消息很常见,并且可以显著地积极影响下游推理。研究结果表明,仅关注答案的正确性是不够的,DHD提供了一种识别有价值的推理轨迹的方法。 AI

影响 这项研究可以通过使多智能体AI系统更好地利用有用的推理(即使是来自不正确的中间步骤)来构建更强大的多智能体AI系统。

排序理由 该集群包含一篇详细介绍AI消息评估新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新协议衡量AI消息的“轨迹价值”,超越答案正确性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Chih-Hsuan Yang, Anjir Ahmed Chowdhury, Cheng-Hau Yang, Weijian Zheng, Fernando Llorente, Xiaolong Ma, Xinyang Li, Eliu A. Huerta, Ian T. Foster, Rajeev Thakur ·

    错误但有用:多智能体消息中答案正确性之外的轨迹价值

    arXiv:2608.14375v1 Announce Type: new Abstract: Multi-agent reasoning systems often use agreement, confidence, or automated scores to decide which messages should shape a final answer. Such filtering assumes that a message likely to be correct is also worth keeping. Yet a wrong a…