PulseAugur
实时 07:12:26

新框架通过不确定性估计增强离线强化学习

研究人员开发了一个名为“不确定性估计下的保守查询和自适应正则化”(CQR-UE)的新框架,以改进离线强化学习。该方法解决了在训练过程中选择信息性偏好查询和有效利用专家反馈的挑战。CQR-UE 利用 Morse 网络估计相对于离线数据集的策略动作不确定性,从而实现保守的查询策略,保持 Bellman 更新的稳定性。它还包含一个自适应正则化方案,在策略优化期间动态调整约束,在 D4RL 基准测试上表现出优越或具有竞争力的性能。 AI

影响 通过增强查询选择和反馈利用来改进离线强化学习,可能导致从静态数据集中获得更稳定有效的策略更新。

排序理由 详细介绍离线强化学习新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架通过不确定性估计增强离线强化学习

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Li-Rong Zhou, Qin-Wen Luo, Sheng-Jun Huang ·

    不确定性估计下的离线强化学习的保守查询与自适应正则化

    arXiv:2607.19199v1 Announce Type: new Abstract: Offline reinforcement learning (RL) aims to learn an effective policy from a static dataset, but its performance is fundamentally limited by dataset coverage. Action preference queries leverage expert feedback without additional env…