实体
HIL-SERL
HIL-SERL
PulseAugur coverage of HIL-SERL — every cluster mentioning HIL-SERL across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的机器人学习方法在30分钟内实现99%的成功率
研究人员开发了一种名为Max-Q选择性模仿的新训练方法,用于机器人在线强化学习中的人机协作。该方法使用MC Q-chunk critic来评估干预措施的动作值,并采用max-Q选择性模仿策略,使Actor能够从人类干预或自身的策略中学习。这种方法显著加快了学习速度,在30分钟内完成了USB插拔等任务的高成功率,优于现有方法。
-
HIL-ResRL:AI机器人适配器1小时微调,成功率提升至95%
研究人员开发了HIL-ResRL,一种用于视觉-语言-动作(VLA)模型的新型适配器,能够对真实世界机器人任务进行快速、安全的微调。该系统使用轻量级的残差策略,并结合了人工干预(human-in-the-loop)来纠正错误,并将预训练的VLA模型适配到特定的工业环境中。在UR5e机器人手臂的测试中,HIL-ResRL在经过仅一小时的实时训练后,在抓取放置和插拔等任务上取得了超过95%的成功率,显著优于现有的强化学习基线,并通过最大限…