PulseAugur
实时 09:31:34
实体 Shirui Chen

Shirui Chen

PulseAugur coverage of Shirui Chen — every cluster mentioning Shirui Chen across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_160811 ·

    TOPReward 使用 VLM 令牌概率进行机器人学习奖励

    研究人员开发了 TOPReward,这是一种新颖的方法,可以在无需手动注释或特定任务奖励模型的情况下,为机器人学习生成密集的、指令驱动的反馈。该方法利用预训练视频语言模型 (VLM) 的内部令牌概率来衡量任务进度,有效地将潜在理解转化为可用的奖励信号。TOPReward 在真实世界操作基准和 Open X-Embodiment 数据集上表现强劲,优于其他无需训练的 VLM 奖励方法,并显示出与训练奖励模型的竞争力。