研究人员开发了一种处理无限期概率约束随机最优控制问题的新方法。通过将问题重新表述为约束马尔可夫决策过程,他们建立了强对偶性,从而在拉格朗日对偶框架中得到一个等价的无约束问题。提出了一种对偶上升算法,以收敛到最优且可行的确定性马尔可夫策略。对于连续状态-输入空间,引入了一种专门的学习算法来在离线设置中近似值函数,从而降低了在线控制的复杂性。 AI
影响 引入了一种优化复杂控制系统的新方法,可能影响需要不确定性下精确决策的领域。
排序理由 该集群包含一篇详细介绍解决特定类别控制问题新方法的学术论文。[lever_c_demoted from research: ic=1 ai=0.4]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →