研究人员推出了Chehre,一个旨在探索视频语言模型解释面部表情感知差异的新数据集。该数据集包含2000多个视频,每个视频由约30人标注,捕捉了由表情符号触发的各种动态面部表情。该资源支持一项名为“分布式表情识别”的新任务,该任务评估模型复制人类感知多样性的能力。初步测试表明,角色提示可以有效地引导模型感知,并使其更好地与人类标注者的反应保持一致。 AI
影响 该数据集可能催生出更强大的视频语言模型,能够理解细微的人类表情。
排序理由 该集群描述了一个在arXiv上发布的新数据集和研究论文,重点关注一项评估视频语言模型的新任务。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →