研究人员开发了一种新颖的物理信息策略迭代方法,用于求解高维 Hamilton--Jacobi--Bellman 方程,该方程在连续时间随机控制中至关重要。该方法在每个策略评估步骤中利用无网格神经网络残差求解器来近似椭圆偏微分方程,然后通过逐点策略改进使用代理梯度。分析证明了 Borel Markov 策略的适定性,并建立了贪婪映射的 Lipschitz 稳定性,提供了受连续 L^p 残差和衰减边界项影响的有限步内部误差界。在包括一个 100 维问题在内的各种测试案例上的实验表明了该方法的有效性,但也识别出了与配置分布和无边界数据梯度确定相关的局限性。 AI
影响 这项研究可能推动 AI 在复杂控制系统和优化问题中的能力。
排序理由 该集群包含一篇研究论文,详细介绍了一种用于求解与 AI 和控制理论相关的复杂数学方程的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Borel Markov policy
- continuous-time stochastic control
- Hamilton--Jacobi--Bellman equations
- inverted pendulum
- linear--quadratic testbed
- neural residual solver
- planar quadrotor
- Yeoneung Kim
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →