研究人员开发了一种用于熵正则化线性二次 (LQ) 控制问题的 Wasserstein 策略梯度 (WPG) 方法。该方法利用了无约束 LQ 控制问题具有线性高斯最优策略这一事实。WPG 方法通过考虑动作空间中的传输来更新动作律,并且 Bellman 验证论证证实了折扣占用加权的逐状态 Wasserstein 梯度与该策略类相切。因此,WPG 方法简化为反馈增益和动作协方差的有限维常微分方程 (ODE),该方程被证明是全局适定的,并且可以从任何允许的初始值指数收敛。 AI
排序理由 学术论文,详细介绍了一种针对特定控制问题的新方法。[lever_c_demoted from research: ic=1 ai=0.7]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →