研究人员开发了用于马尔可夫决策过程(MDP)中策略评估的新在线学习算法,该算法纳入了动态基于效用的损失风险(UBSR)度量。提出的UBSR-TD算法及其变体设计用于与线性函数逼近高效使用,并建立了几乎必然收敛的条件。这些方法通过修改具有特定损失函数的时序差分误差来调整现有的风险中性策略评估算法,并通过实验证明了其在实践中的效用,包括在保质期不确定性下的易腐库存管理中的应用。 AI
影响 增强了顺序决策问题中风险感知强化学习的能力。
排序理由 学术论文,详细介绍了MDP中策略评估的新算法。[lever_c_demoted from research: ic=1 ai=1.0]
- Markov decision processes
- Perishable Inventory Management Using GA-ANN and ICA-ANN
- reinforcement learning
- UbSRD: The Ubiquitin Structural Relational Database
- UBSR-TD
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →