研究人员开发了 VideoTIR,一种用于改进多模态大语言模型 (MLLM) 对长视频理解能力的新颖方法。VideoTIR 利用强化学习指导 MLLM 有效地使用工具包来解析和聚焦长视频内容中有意义的片段,从而减少幻觉并提高准确性。该系统集成了工具动作分组策略优化 (TAGPO),通过分步奖励和重复利用失败尝试来提高效率,并结合了沙盒框架来生成高质量的训练数据。在三个长视频问答基准上的实验证明了 VideoTIR 的有效性和效率。 AI
影响 增强了 LLM 分析长视频内容的能力,可能改进视频搜索、摘要和内容审核等应用。
排序理由 该集群包含一篇详细介绍 AI 模型改进新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Multimodal Large Language Models
- reinforcement learning
- ScienceCast
- Toolkit Action Grouped Policy Optimization
- VideoTIR
- Zhe Gao
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →