PulseAugur
中
实时 19:31:23
实体 Pontryagin Maximum Principle

Pontryagin Maximum Principle

PulseAugur coverage of Pontryagin Maximum Principle — every cluster mentioning Pontryagin Maximum Principle across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_275336 ·

    新研究统一随机最优控制框架

    一篇新发表在arXiv上的研究论文介绍了一个统一的随机最优控制框架,弥合了Itô微积分和Rough Path理论之间的差距。该研究展示了从这两种不同的数学框架推导出的最优性条件之间的联系,表明Itô Pontryagin最大值原理(PMP)是Rough PMP的条件期望。这种统一被应用于改进生成模型和开发一种新的反馈控制问题方法,为流行的随机控制方法提供了一个新颖的条件桥梁。

  2. TOOL · CL_108082 ·

    新方法使用Hessian数据改进最优控制近似

    研究人员开发了一种新颖的数据驱动方法,用于近似具有非线性控制仿射动力学的确定性最优控制问题中的价值函数。该方法利用Pontryagin最大值原理生成训练数据,包括价值函数的值、梯度和Hessian。通过用这种二阶信息增强加权最小二乘回归,该方法与仅基于价值的回归相比,显著降低了样本复杂度。该技术已在状态维度不断增加的问题上得到验证,证明了近似精度和闭环性能的提高,并且所需训练样本数量大幅减少。

  3. RESEARCH · CL_41862 ·

    新的 PG-DPO 框架增强了用于非指数贴现的强化学习能力

    研究人员开发了一个名为庞特里亚金引导的直接策略优化 (PG-DPO) 的新框架,以解决强化学习方法的局限性。使用贝尔曼风格递归的传统方法在处理非指数贴现时遇到困难,而非指数贴现常见于模拟人类偏好和生存场景。PG-DPO 放弃了递归,而是将庞特里亚金最大值原理与蒙特卡洛滚动相结合,在专业基准测试上实现了更高的准确性和稳定性。