研究人员开发了一种新的强化学习(RL)算法,该算法专门用于连续时间跳跃马尔可夫决策过程(CTJMDPs)。这种新颖的方法将RL能力扩展到具有通用离散状态空间和连续或离散动作空间的领域,这些领域在运筹学中很常见,例如动态定价。该算法为CTJMDPs中的q学习奠定了理论基础,并在网络动态定价场景中的成功应用证明了其在经验上优于传统的时域离散化方法。 AI
影响 将强化学习能力扩展到更广泛的运营问题领域,有望改善动态定价和资源管理。
排序理由 学术论文,详细介绍了一种针对特定类型马尔可夫决策过程的新算法。[lever_c_demoted from research: ic=1 ai=1.0]
- Continuous-Time Jump Markov Decision Processes
- Gallego and van Ryzin
- Hugging Face
- Jia and Zhou
- Network Dynamic Pricing
- reinforcement learning
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →