研究人员开发了Avalon-ToM-Bench,这是一个旨在评估大型语言模型(LLM)细粒度心智理论(ToM)能力的新基准。该基准利用了游戏《抵抗组织:阿瓦隆》的非对称信息机制,侧重于心理状态推理的具体方面,而非端到端的游戏玩法。对28个LLM进行的初步测试表明,模型在社交推理和表达推断出的心理状态方面比理解游戏规则或拥有领域知识更具挑战性。研究结果还表明,专门的推理训练比仅仅增加推理时间的审议更能有效地提高ToM。 AI
影响 该基准可能导致对LLM社交推理进行更细致的评估,从而可能推动代理交互能力的改进。
排序理由 该集群包含一篇详细介绍评估AI能力新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →