实体
MeetingToM
MeetingToM
PulseAugur coverage of MeetingToM — every cluster mentioning MeetingToM across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的基准测试 MeetingToM 评估大语言模型在会议中的社交推理能力
研究人员推出了 MeetingToM,这是一个新的基准测试,旨在评估多模态大语言模型(MLLMs)在多方会议情境下的心智理论(ToM)能力。该基准测试通过关注潜在的社交状态和群体动态(例如,表面上的一致但私下有异议的伪共识)来解决现有评估的局限性。MeetingToM 在个体、二元和群体层面评估 ToM,对当前 MLLMs 的分析显示,在整合非语言线索和推断隐藏态度方面仍然存在挑战。
-
新的基准MeetingToM测试多模态大语言模型在社交推理方面的能力
研究人员推出了MeetingToM,这是一个旨在评估多模态大语言模型(MLLMs)在多人会议情境下心智理论能力的新基准。该基准通过关注潜在的社交状态和群体动态(例如,表面上一致但私下有异议的伪共识)来解决现有评估的局限性。MeetingToM在个体、二元和群体层面评估MLLMs,初步分析显示当前模型在整合非语言线索和推断隐藏态度方面仍面临持续挑战。