研究人员开发了一个名为“不确定性估计下的保守查询和自适应正则化”(CQR-UE)的新框架,以改进离线强化学习。该方法解决了在训练过程中选择信息性偏好查询和有效利用专家反馈的挑战。CQR-UE 利用 Morse 网络估计相对于离线数据集的策略动作不确定性,从而实现保守的查询策略,保持 Bellman 更新的稳定性。它还包含一个自适应正则化方案,在策略优化期间动态调整约束,在 D4RL 基准测试上表现出优越或具有竞争力的性能。 AI
影响 通过增强查询选择和反馈利用来改进离线强化学习,可能导致从静态数据集中获得更稳定有效的策略更新。
排序理由 详细介绍离线强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- Bellman update
- Conservative Query and Adaptive Regularization under Uncertainty Estimation
- D4RL benchmark
- Morse network
- Offline RL
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →