PulseAugur
实时 10:35:10

TOPReward 使用 VLM 令牌概率进行机器人学习奖励

研究人员开发了 TOPReward,这是一种新颖的方法,可以在无需手动注释或特定任务奖励模型的情况下,为机器人学习生成密集的、指令驱动的反馈。该方法利用预训练视频语言模型 (VLM) 的内部令牌概率来衡量任务进度,有效地将潜在理解转化为可用的奖励信号。TOPReward 在真实世界操作基准和 Open X-Embodiment 数据集上表现强劲,优于其他无需训练的 VLM 奖励方法,并显示出与训练奖励模型的竞争力。 AI

影响 通过提供密集、自动化的奖励信号,实现更高效、可扩展的机器人学习。

排序理由 详细介绍机器人学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

TOPReward 使用 VLM 令牌概率进行机器人学习奖励

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Shirui Chen, Cole Harrison, Ying-Chun Lee, Angela Jin Yang, Zhongzheng Ren, Lillian J. Ratliff, Jiafei Duan, Dieter Fox, Ranjay Krishna ·

    TOPReward:Token 概率作为机器人技术的隐藏零样本奖励

    arXiv:2602.19313v2 Announce Type: replace-cross Abstract: General-purpose robot learning requires dense, instruction-conditioned feedback that can distinguish meaningful task progress from stalled, failed, or partially completed behavior. Yet obtaining such feedback at scale rema…