PulseAugur
实时 07:13:59
实体 Pengzhi Yang

Pengzhi Yang

PulseAugur coverage of Pengzhi Yang — every cluster mentioning Pengzhi Yang across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_218127 ·

    新的RARM方法通过单次演示提升机器人操纵强化学习

    研究人员开发了一种名为RARM(参考锚定奖励模型)的新方法,以改进机器人操纵任务的强化学习。RARM使用一次成功的演示来创建感知进度的奖励信号,无需特定任务的演示或手动奖励工程。该方法在模拟和现实世界的操纵任务中显示出更高的成功率,尤其在诸如折叠衣物等复杂、长时域任务中表现出色,这些任务需要精确的进度估计。