研究人员开发了PreferenceEKF,一种用于人类反馈强化学习(RLHF)中主动学习的新方法。该方法通过将主动偏好学习构建为序贯贝叶斯滤波问题来解决RLHF的样本效率低下问题。PreferenceEKF不进行全参数空间推理,而是在低维子空间中使用扩展卡尔曼滤波器,在收集新偏好时高效地更新奖励模型后验。在D4RL和V-D4RL基准上的实验表明,与现有的贝叶斯深度学习方法相比,该方法在样本效率、运行时间、可扩展性和校准方面都有所提高,从而在离线强化学习策略性能方面具有竞争力。 AI
影响 该方法可以显著减少使用人类反馈训练AI模型所需的数据量,使RLHF更实用、更具可扩展性。
排序理由 该集群包含一篇详细介绍AI主动奖励学习新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →