PulseAugur
实时 13:11:55
English(EN) Robo-Dopamine 2.0: History-Conditioned and OOD-Aware Process Reward Modeling for Robotic Manipulation

Robo-Dopamine 2.0 通过历史感知奖励增强机器人操作

研究人员开发了 Robo-Dopamine 2.0,这是一种先进的过程奖励模型,旨在通过解决当前视觉-语言-动作 (VLA) 模型的局限性来改进机器人操作。该新模型结合了历史条件化和分布外 (OOD) 感知奖励,利用参考面板和观察到的滚动历史来更好地区分有效进展和任务无效失败。一种新颖的、具有转换感知重放的 Signed-Hop Curriculum 有助于学习,从而在视觉顺序一致性和下游强化学习任务(包括成功的现实世界插入)方面取得显著改进。 AI

影响 通过解决累积误差和稀疏奖励信号来提高机器人操作任务的鲁棒性和效率。

排序理由 该集群包含一篇详细介绍机器人操作新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

Robo-Dopamine 2.0 通过历史感知奖励增强机器人操作

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Yijie Xu, Haopeng Jin, Run Zhou, Shengbang Liu, Sixiang Chen, Hongyang Cheng, Sicheng Hu, Peterson Co, Jinwen Luo, Huajie Tan, Shanghang Zhang ·

    Robo-Dopamine 2.0:历史条件和OOD感知过程奖励建模用于机器人操作

    arXiv:2608.15680v1 Announce Type: cross Abstract: Vision-language-action (VLA) models improve robotic manipulation but remain vulnerable to compounding errors, scene changes, and off-trajectory states. Reinforcement learning can refine pretrained VLA policies, yet sparse success …