研究人员推出了 Video2Reaction,这是一个新的多模态数据集和基准,旨在预测观众对视频内容的情感反应。该数据集包含超过 10,000 个视频,利用一个两阶段的流程和开源 LLM 来标注社交媒体引发的情绪,准确率达到 86%。虽然微调的基础视频模型显示出潜力,但即使是 LLaVA-NeXT 等最先进的方法在处理固有的主观性时也面临挑战,在预测主要反应方面仅达到 77% 的 Top-3 F1 分数。 AI
影响 该数据集可以通过更好地预测观众的情感反应,从而推动视频理解和个性化内容推荐方面的研究。
排序理由 该集群描述了一篇介绍特定 AI 任务数据集和基准的新学术论文。
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →