一篇新发表在arXiv上的研究论文指出了用于评估视听问答模型的关键工具IntentBench基准存在重大问题。研究人员发现,该基准中的大部分问题要么是损坏的,要么无需视频输入即可轻松回答。他们发布了一个名为Intentbench-Prime的清理版本。此外,研究表明,这些模型的当前推理方法成本高昂且效果出奇地差,一个简单的微调模型(Vanilla SFT)以一小部分成本就能表现得相当或更好。研究还表明,模型仅通过文本就能学习到重要的社交理解先验知识,有时甚至优于基于视频的方法。 AI
影响 强调了当前多模态LLM在社交理解方面的局限性,并提出了更有效的评估方法。
排序理由 发表在arXiv上的研究论文,详细介绍了关于AI基准的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →