研究人员开发了一种新颖的多智能体强化学习框架,用于视频推理任务,例如基于文本的视频问答和时间定位。该方法将一个可训练的“定位器”与一个冻结的“验证器”相结合,以改进相关时间证据的选择。使用此方法训练的一个拥有20亿参数的模型在各种视频推理基准测试中展现了零样本迁移能力,在交并比和答案定位指标上取得了显著的准确性。 AI
影响 引入了一种新颖的视频推理模型训练范式,有望改进证据选择和跨任务迁移能力。
排序理由 详细介绍新模型架构和训练方法的学术论文。[lever_c_research降级:ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →