研究人员推出了一种新颖的视频多模态大语言模型(MLLM)训练后方法——行为包优化(BPO)。BPO通过计算反事实视图输出包的奖励,解决了MLLM依赖外观和语言先验而非时间证据的问题。该方法鼓励模型在发生无关干预时保持稳定,在关键证据被移除时保持敏感,并在没有证据时弃权。将其应用于Qwen2.5-7B-Instruct后,BPO显著提高了在TempCompass、MVBench和NExT-QA等基准测试上的准确性,并在Video-MME、LongVideoBench和LLaVA-Video-7B上也有所提升。 AI
影响 通过改进时间证据利用来增强视频LLM的推理能力,有望实现更可靠的视频理解。
排序理由 详细介绍一种改进视频多模态大语言模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Behavior Pack Optimization
- GRPO
- LLaVA-Video-7B
- LongVideoBench
- MVBench
- NExT-QA
- Qwen2.5-VL-7B-Instruct
- TempCompass
- Video-MME
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →