PulseAugur
实时 06:54:27
English(EN) Reinforcement Learning for Continuous-Time Jump Markov Decision Processes with Applications to Network Dynamic Pricing

新的强化学习算法解决了连续时间跳跃马尔可夫决策过程问题

研究人员开发了一种新的强化学习(RL)算法,该算法专门用于连续时间跳跃马尔可夫决策过程(CTJMDPs)。这种新颖的方法将RL能力扩展到具有通用离散状态空间和连续或离散动作空间的领域,这些领域在运筹学中很常见,例如动态定价。该算法为CTJMDPs中的q学习奠定了理论基础,并在网络动态定价场景中的成功应用证明了其在经验上优于传统的时域离散化方法。 AI

影响 将强化学习能力扩展到更广泛的运营问题领域,有望改善动态定价和资源管理。

排序理由 学术论文,详细介绍了一种针对特定类型马尔可夫决策过程的新算法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的强化学习算法解决了连续时间跳跃马尔可夫决策过程问题

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Huiling Meng, Ningyuan Chen, Xuefeng Gao ·

    面向网络动态定价应用的连续时间跳跃马尔可夫决策过程的强化学习

    arXiv:2608.20680v1 Announce Type: new Abstract: We study reinforcement learning (RL) in Continuous-Time Jump Markov Decision Processes (CTJMDPs) featuring general discrete state spaces (which need not possess a vector space structure) and continuous/discrete action spaces. The se…