研究人员开发了一种名为“多样化假设审议”(DHD)的新协议,用于评估多智能体推理系统中消息的价值,即使这些消息包含不正确的答案。DHD协议通过评估消息的包含是否帮助或损害了后续推理,独立于其最终答案的正确性来衡量消息的“轨迹价值”。使用GPT-OSS 120B和Gemma 4-31B-it模型在各种基准测试上的实验表明,“错误但有用”的消息很常见,并且可以显著地积极影响下游推理。研究结果表明,仅关注答案的正确性是不够的,DHD提供了一种识别有价值的推理轨迹的方法。 AI
影响 这项研究可以通过使多智能体AI系统更好地利用有用的推理(即使是来自不正确的中间步骤)来构建更强大的多智能体AI系统。
排序理由 该集群包含一篇详细介绍AI消息评估新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX Code Finder for Papers
- CORE Recommender
- DagsHub
- Diverse Hypothesis Deliberation
- Gemma 4-31B-it
- Gotit.pub
- GPT-OSS 120B
- Hugging Face
- Influence Flower
- ScienceCast
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →