PulseAugur
实时 08:36:38
English(EN) Wasserstein Policy Gradient for Entropy-Regularized Linear-Quadratic Control

新的 Wasserstein 策略梯度方法用于 LQ 控制问题

研究人员开发了一种用于熵正则化线性二次 (LQ) 控制问题的 Wasserstein 策略梯度 (WPG) 方法。该方法利用了无约束 LQ 控制问题具有线性高斯最优策略这一事实。WPG 方法通过考虑动作空间中的传输来更新动作律,并且 Bellman 验证论证证实了折扣占用加权的逐状态 Wasserstein 梯度与该策略类相切。因此,WPG 方法简化为反馈增益和动作协方差的有限维常微分方程 (ODE),该方程被证明是全局适定的,并且可以从任何允许的初始值指数收敛。 AI

排序理由 学术论文,详细介绍了一种针对特定控制问题的新方法。[lever_c_demoted from research: ic=1 ai=0.7]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 Wasserstein 策略梯度方法用于 LQ 控制问题

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Zhaoyu Zhu, Rui Gao, Shuang Li ·

    Wasserstein策略梯度用于熵正则化线性二次控制

    arXiv:2608.07433v1 Announce Type: cross Abstract: Wasserstein policy gradient (WPG) updates state-conditional action laws by transport in the action space. We study entropy-regularized discounted linear-quadratic (LQ) control. A Bellman verification argument shows that the unrest…