PulseAugur
实时 05:19:11
English(EN) On the convergence of optimistic policy iteration for stochastic shortest path problem

研究论文详细介绍了随机最短路径问题中乐观策略迭代的收敛性

这篇提交至 arXiv 计算机科学 > 机器学习板块的论文,针对随机最短路径问题提出了一种特定的乐观策略迭代算法,并展示了其收敛性结果。该研究由 Yuanlong Chen 撰写,详细介绍了在假定终止状态必然会达到的情况下,使用蒙特卡洛和 TD(lambda) 方法进行策略评估。 AI

排序理由 该集群包含一篇关于机器学习主题的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

研究论文详细介绍了随机最短路径问题中乐观策略迭代的收敛性

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Yuanlong Chen ·

    随机最短路径问题下乐观策略迭代的收敛性研究

    arXiv:1808.08763v3 Announce Type: replace Abstract: In this paper, we prove some convergence results of a special case of optimistic policy iteration algorithm for stochastic shortest path problem. We consider both Monte Carlo and $TD(\lambda)$ methods for the policy evaluation s…