PulseAugur
实时 12:43:32
English(EN) Reasoning for Social Audio-Visual Question Answering: Where Do We Stand?

在多模态大语言模型(MLLM)社交理解存在缺陷之际,发布了新的基准测试 Intentbench-Prime

一篇新论文强调了用于评估多模态大语言模型(MLLM)在社交视听理解方面能力的 IntentBench 基准测试存在重大问题。研究人员发现,IntentBench 中的大部分问题存在缺陷,或者无需视频输入即可回答,这促使研究人员发布了一个改进后的基准测试,名为 Intentbench-Prime。该研究还揭示,当前的链式思考(chain-of-thought)推理方法成本高昂且效果出奇地不佳,一个简单的 Vanilla SFT 基线模型以极低的成本取得了相当或更好的结果。此外,分析表明,MLLM 可以仅从文本中学习到重要的知识,甚至在仅提供文本字幕时,其表现优于基于视频的方法,这表明当前模型在社交理解能力方面存在局限性。 AI

影响 强调了当前 MLLM 在社交理解方面的局限性,并提出了一个更可靠的基准测试和基线模型。

排序理由 研究论文,详细介绍了基准测试的缺陷和新的基线模型。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

在多模态大语言模型(MLLM)社交理解存在缺陷之际,发布了新的基准测试 Intentbench-Prime

报道来源 [2]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    社交视听问答的推理:我们站在何处?

    Training Multimodal Large Language Models for audio-visual social understanding is a crucial step toward embodied social intelligence. Chain-of-thought (CoT) reasoning has become the dominant approach, with HumanOmniV2 and its IntentBench benchmark as a prominent reference point.…

  2. arXiv cs.CV TIER_1 English(EN) · Koen P. de Vries, Xavier Alameda-Pineda, Estefan\'ia Talavera, St\'ephane Lathuili\`ere ·

    社会视听问答的推理:我们站在哪里?

    arXiv:2608.13239v1 Announce Type: new Abstract: Training Multimodal Large Language Models for audio-visual social understanding is a crucial step toward embodied social intelligence. Chain-of-thought (CoT) reasoning has become the dominant approach, with HumanOmniV2 and its Inten…