研究人员推出MMHBench,这是一个旨在评估多模态大语言模型(MLLMs)对长视频中心理健康理解能力的新基准。该基准包含268个视频和2000多个问题,分为对可观察行为的第三人称评估和对心理状态的第一人称视角扮演。对22个领先MLLMs的评估显示,当前模型在此复杂任务上仍面临显著挑战。 AI
影响 该基准突显了AI理解复杂人类情感和社会动态方面的挑战,可能指导未来在更细致的AI推理方面的研究。
排序理由 该条目描述了一个用于评估AI模型的新学术基准。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →