PulseAugur
实时 08:12:34
English(EN) Avalon-ToM-Bench: Evaluating Fine-Grained Theory of Mind via Asymmetric Game Mechanics

新基准使用非对称博弈机制评估LLM心智理论

研究人员开发了Avalon-ToM-Bench,这是一个旨在评估大型语言模型(LLM)细粒度心智理论(ToM)能力的新基准。该基准利用了游戏《抵抗组织:阿瓦隆》的非对称信息机制,侧重于心理状态推理的具体方面,而非端到端的游戏玩法。对28个LLM进行的初步测试表明,模型在社交推理和表达推断出的心理状态方面比理解游戏规则或拥有领域知识更具挑战性。研究结果还表明,专门的推理训练比仅仅增加推理时间的审议更能有效地提高ToM。 AI

影响 该基准可能导致对LLM社交推理进行更细致的评估,从而可能推动代理交互能力的改进。

排序理由 该集群包含一篇详细介绍评估AI能力新基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准使用非对称博弈机制评估LLM心智理论

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yen-Shan Chen, Yu Chian Duan, Chih-En Kuo, Jian-Bin Wu, Yun-Nung Chen ·

    Avalon-ToM-Bench:通过非对称博弈机制评估细粒度心智理论

    arXiv:2608.09638v1 Announce Type: new Abstract: Theory of Mind (ToM) is essential for agent interactions, yet existing evaluations either rely on static scenarios that oversimplify mental-state reasoning or interactive settings that provide limited diagnostic insight. We present …