研究人员推出了一种新颖的代理框架SCOUT,旨在改进对极长以自我为中心的视频的推理。SCOUT包含一个自检和恢复感知策略,可动态平衡视频片段的探索和利用。为了应对训练这些代理的挑战,研究团队开发了UPS-GRPO,这是一种不确定性优先策略优化方法,可增强长视界决策的信用分配。实验表明,SCOUT在超长以自我为中心的视频基准测试中取得了最先进的性能。 AI
影响 引入了一个新框架,用于改进AI在扩展视频数据上进行推理的能力,可能影响需要长期时间理解的应用。
排序理由 详细介绍AI新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →