实体
Bellman update
Bellman update
PulseAugur coverage of Bellman update — every cluster mentioning Bellman update across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新框架通过不确定性估计增强离线强化学习
研究人员开发了一个名为“不确定性估计下的保守查询和自适应正则化”(CQR-UE)的新框架,以改进离线强化学习。该方法解决了在训练过程中选择信息性偏好查询和有效利用专家反馈的挑战。CQR-UE 利用 Morse 网络估计相对于离线数据集的策略动作不确定性,从而实现保守的查询策略,保持 Bellman 更新的稳定性。它还包含一个自适应正则化方案,在策略优化期间动态调整约束,在 D4RL 基准测试上表现出优越或具有竞争力的性能。
-
新的DRRL算法通过线性逼近实现有限时间收敛
研究人员开发了一种新的分布鲁棒强化学习(DRRL)算法,即使在使用线性函数逼近的情况下也能提供有限时间收敛保证。该算法解决了现有DRRL方法的局限性,这些方法通常需要表格设置或特定的结构假设。新方法结合了目标网络和对偶函数逼近方案,利用矩跟踪批评者和后缀平均来实现收敛到最优鲁棒Q函数。