研究人员推出了一种新颖的框架VideoTreeSearch (VTS),该框架通过将长视频问答任务视为自适应时间树上的自纠错搜索来改进该任务。与先前使用单一操作来缩小视频片段范围的方法不同,VTS采用了四种操作——放大(zoom_in)、缩小(zoom_out)、移动(shift)和回答(answer)——以实现显式的回溯和错误恢复。这种分层搜索方法通过轨迹合成管道进行训练,并通过准确性奖励进行强化,在CG-Bench和Haystack-Ego4D等多个基准测试中显著优于现有的智能体方法,并显示出对通用长视频问答任务的强大迁移能力。 AI
影响 通过实现更鲁棒的导航和错误纠正,增强了AI准确回答长视频问题的能力。
排序理由 这是一篇详细介绍视频问答新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →