PulseAugur
实时 08:53:10
实体 V-D4RL

V-D4RL

PulseAugur coverage of V-D4RL — every cluster mentioning V-D4RL across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_235466 ·

    新方法提高了从人类偏好中学习AI奖励模型的效率

    研究人员开发了PreferenceEKF,一种用于人类反馈强化学习(RLHF)中主动学习的新方法。该方法通过将主动偏好学习构建为序贯贝叶斯滤波问题来解决RLHF的样本效率低下问题。PreferenceEKF不进行全参数空间推理,而是在低维子空间中使用扩展卡尔曼滤波器,在收集新偏好时高效地更新奖励模型后验。在D4RL和V-D4RL基准上的实验表明,与现有的贝叶斯深度学习方法相比,该方法在样本效率、运行时间、可扩展性和校准方面都有所提高,…