PulseAugur
实时 11:42:38
English(EN) Online Policy Evaluation for MDPs with Dynamic UBSR Measures

新算法增强了MDP中风险感知强化学习

研究人员开发了用于马尔可夫决策过程(MDP)中策略评估的新在线学习算法,该算法纳入了动态基于效用的损失风险(UBSR)度量。提出的UBSR-TD算法及其变体设计用于与线性函数逼近高效使用,并建立了几乎必然收敛的条件。这些方法通过修改具有特定损失函数的时序差分误差来调整现有的风险中性策略评估算法,并通过实验证明了其在实践中的效用,包括在保质期不确定性下的易腐库存管理中的应用。 AI

影响 增强了顺序决策问题中风险感知强化学习的能力。

排序理由 学术论文,详细介绍了MDP中策略评估的新算法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新算法增强了MDP中风险感知强化学习

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Weikai Wang, Erick Delage ·

    具有动态UBSR度量的MDP在线策略评估

    arXiv:2607.23030v1 Announce Type: new Abstract: Developing efficient function-approximation methods for policy evaluation is a fundamental challenge in risk-aware reinforcement learning. Existing approaches either focus on restrictive classes of risk measures or rely on access to…