一篇研究论文介绍了一个新的基准STEMO-Bench,旨在评估多模态大语言模型(MLLMs)在视频理解中的时空监控能力。该论文认为,由于缺乏持久的对象跟踪,现有基准未能充分诊断MLLMs在动态场景中产生幻觉的倾向。为了解决这个问题,研究人员还提出了STEMO-Track,一个构建和推理对象轨迹以改善时间推理和减少MLLMs幻觉的框架。 AI
影响 引入了一种新的方法来评估并可能改善视频理解LLMs的时间推理能力并减少幻觉。
排序理由 介绍用于评估多模态大语言模型的新基准和框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →