一篇新发表在arXiv上的研究分析了大型语言模型(LLM)之间的多智能体辩论在提高答案质量方面的有效性。研究人员开发了四个指标来衡量一致性、实际反驳、持续立场和token对数概率。在不同语气下,使用三模型委员会对GlobalOpinionQA数据集进行辩论的实验显示,虽然辩论可以改变智能体所说的话,但改变其持续认可或提高最终答案质量的证据有限。研究表明,辩论结果中感知的改进可能源于阅读顺序而非真实的质量提升。 AI
影响 挑战了多智能体辩论会固有地提高LLM答案质量的假设,并指出了评估中潜在的偏差。
排序理由 发表在arXiv上的研究论文,详细分析了LLM辩论。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →