研究人员开发了一种名为“无经验自主奖励规范”(EARS)的新方法,用于在强化学习中设计奖励函数,而无需与环境进行交互。该方法使用大型语言模型(LLM)根据任务描述构建奖励特征,然后从对想象轨迹的偏好中学习特征权重。EARS已在复杂的长期任务中进行了评估,包括疫情监管、胰岛素给药和自动驾驶控制,证明了与其他无交互方法相比,它在创建与期望结果更一致的奖励函数方面的有效性。 AI
影响 在环境交互成本高昂或不可行的环境中实现奖励函数设计,可能加速强化学习的部署。
排序理由 学术论文,详细介绍了一种新的强化学习方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Experience-Free Autonomous Reward Specification
- Hugging Face
- Large Language Model
- reinforcement learning
- Stephane Hatgis-Kessell
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →