PulseAugur
实时 11:04:43
实体 Experience-Free Autonomous Reward Specification

Experience-Free Autonomous Reward Specification

PulseAugur coverage of Experience-Free Autonomous Reward Specification — every cluster mentioning Experience-Free Autonomous Reward Specification across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_254409 ·

    新的强化学习方法在无需环境采样的情况下学习奖励

    研究人员开发了一种名为“无经验自主奖励规范”(EARS)的新方法,用于在强化学习中设计奖励函数,而无需与环境进行交互。该方法使用大型语言模型(LLM)根据任务描述构建奖励特征,然后从对想象轨迹的偏好中学习特征权重。EARS已在复杂的长期任务中进行了评估,包括疫情监管、胰岛素给药和自动驾驶控制,证明了与其他无交互方法相比,它在创建与期望结果更一致的奖励函数方面的有效性。