研究人员推出了 MeetingToM,这是一个新的基准测试,旨在评估多模态大语言模型(MLLMs)在多方会议情境下的心智理论(ToM)能力。该基准测试通过关注潜在的社交状态和群体动态(例如,表面上的一致但私下有异议的伪共识)来解决现有评估的局限性。MeetingToM 在个体、二元和群体层面评估 ToM,对当前 MLLMs 的分析显示,在整合非语言线索和推断隐藏态度方面仍然存在挑战。 AI
影响 该基准测试有望推动 AI 在理解和参与复杂社交互动方面的能力取得进步。
排序理由 该集群描述了一篇介绍用于评估 AI 模型基准测试的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- MeetingToM
- Multimodal Large Language Models and Tunings: Vision, Language, Sensors, Audio, and Beyond
- pseudo-consensus
- theory of mind
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →