研究人员开发了PROMO,一种用于四足机器人的新型偏好条件多目标强化学习方法。该方法允许单一运动策略在运行时适应不同的操作员偏好,平衡诸如命令跟踪、稳定性和能效等目标。PROMO在模拟中展示了广泛的帕累托覆盖率和可预测的偏好响应,在转移到Unitree Go2机器人后,在能效、位置误差和身体姿态偏差方面取得了显著改进。 AI
影响 通过将操作员意图与固定的奖励函数分离,实现了更具适应性和用户可控性的机器人运动。
排序理由 详细介绍机器人强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Preference-conditioned Multi-Objective Reinforcement Learning
- quadrupedal robots
- reinforcement learning
- Unitree Go2
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →