这篇提交至 arXiv 计算机科学 > 机器学习板块的论文,针对随机最短路径问题提出了一种特定的乐观策略迭代算法,并展示了其收敛性结果。该研究由 Yuanlong Chen 撰写,详细介绍了在假定终止状态必然会达到的情况下,使用蒙特卡洛和 TD(lambda) 方法进行策略评估。 AI
排序理由 该集群包含一篇关于机器学习主题的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →