两篇新研究论文探讨了使用大型语言模型(LLM)进行评估的多智能体系统(MAS)的有效性。第一篇论文侧重于客观问答,发现虽然生成的候选答案中通常包含正确答案,但系统仍可能收敛于错误答案。研究还表明,评判者的可靠性因任务而异,并且将答案频率与评判者评估相结合可将准确性从63.82%提高到70%以上。第二篇论文研究了主观评估,发现单一评判者基线通常优于多智能体共识,特别是在严格的角色扮演引入了共识无法纠正的向下偏差时。这种偏差可能导致人为的一致,牺牲了与人类的一致性。 AI
影响 这些研究突显了在使用基于LLM的多智能体系统进行评估时可能存在的陷阱,表明需要仔细设计以确保准确性和与人类的一致性。
排序理由 两篇在arXiv上发表的学术论文,讨论了多智能体系统中LLM的评估方法。
在 arXiv cs.MA (Multiagent) 阅读 →
- GPQA
- Humanity's Last Exam
- LLM
- MedXpertQA
- MMLU-Pro
- Multi-Agent Debate
- multi-agent systems
- Symmetric MAD
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →