一篇新论文强调了用于评估多模态大语言模型(MLLM)在社交视听理解方面能力的 IntentBench 基准测试存在重大问题。研究人员发现,IntentBench 中的大部分问题存在缺陷,或者无需视频输入即可回答,这促使研究人员发布了一个改进后的基准测试,名为 Intentbench-Prime。该研究还揭示,当前的链式思考(chain-of-thought)推理方法成本高昂且效果出奇地不佳,一个简单的 Vanilla SFT 基线模型以极低的成本取得了相当或更好的结果。此外,分析表明,MLLM 可以仅从文本中学习到重要的知识,甚至在仅提供文本字幕时,其表现优于基于视频的方法,这表明当前模型在社交理解能力方面存在局限性。 AI
影响 强调了当前 MLLM 在社交理解方面的局限性,并提出了一个更可靠的基准测试和基线模型。
排序理由 研究论文,详细介绍了基准测试的缺陷和新的基线模型。
在 Hugging Face Daily Papers 阅读 →
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →