研究人员开发了一种新方法来提高多模态大型语言模型(MLLM)在视频理解方面的一致性。所提出的方法解决了MLLM在生成全局合理的输出时,却会虚构对象存在、错误归属属性或合并重复事件的问题。通过将字幕分解为事实性和时间性声明,研究表明标准的句子级监督不足以实现忠实的视频理解。为了解决这个问题,引入了一个结构化奖励系统,包括事实场景图奖励、时间事件排序奖励和视频基础问答奖励以进行自我验证。这种结构化奖励塑造在各种基准测试中都显示出了一致的提升,从而实现了更可靠的视频理解。 AI
影响 这项研究提供了一种提高视频理解模型可靠性和事实依据的方法,有望减少幻觉并提高应用中的准确性。
排序理由 这是一篇详细介绍改进多模态大型语言模型新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →