研究人员开发了 TOPReward,这是一种新颖的方法,可以在无需手动注释或特定任务奖励模型的情况下,为机器人学习生成密集的、指令驱动的反馈。该方法利用预训练视频语言模型 (VLM) 的内部令牌概率来衡量任务进度,有效地将潜在理解转化为可用的奖励信号。TOPReward 在真实世界操作基准和 Open X-Embodiment 数据集上表现强劲,优于其他无需训练的 VLM 奖励方法,并显示出与训练奖励模型的竞争力。 AI
影响 通过提供密集、自动化的奖励信号,实现更高效、可扩展的机器人学习。
排序理由 详细介绍机器人学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- DagsHub
- Gotit.pub
- Hugging Face
- ManiRewardBench
- ScienceCast
- Shirui Chen
- TOPReward
- Video-Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →