dynamic programming
PulseAugur coverage of dynamic programming — every cluster mentioning dynamic programming across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
强化学习:在没有模型的情况下学习
本文探讨了强化学习(RL)中不需要预先存在环境模型的方法,并将其与动态规划方法进行了对比。文章强调了价值迭代等方法在依赖转移概率和奖励模型方面的局限性。文章介绍了通过试错学习的无模型强化学习技术,类似于多臂老虎机问题,并提醒了价值函数在强化学习中的作用。
-
新的基于PINN的框架求解复杂HJI方程
研究人员开发了一个新框架,将动态规划与物理信息神经网络(PINNs)相结合,以求解称为Hamilton--Jacobi--Isaacs(HJI)方程的复杂数学方程。该方法旨在处理高维和非凸HJI方程,这些方程在随机微分博弈和鲁棒控制等领域至关重要。所提出的方法在求解线性偏微分方程和使用自动微分更新控制策略之间交替进行,并展示了可证明的稳定性和收敛性。数值实验表明了该方法的准确性和可扩展性,在某些应用中优于直接PINN求解器,并显示出在…
-
新方法应对多智能体决策中的复杂性
研究人员提出了一种新颖的方法来解决多智能体系统中去中心化部分可观察马尔可夫决策过程(DecPOMDPs)的指数级复杂性问题。该论文提出将焦点从计数智能体转移到计数策略,一种称为“策略计数DecPOMDPs”的方法,从而在智能体数量上实现可处理性。这个新框架利用策略计数动态规划来有效地解决这些复杂问题。
-
New Bounds for Transformer Training via Optimal Control and Robust Optimization
研究人员为 Transformer 训练开发了新的有限样本泛化界限,将该过程构建为一个马尔可夫控制问题。通过分析量化模型并使用集中不等式,他们为度量空间上的经验定律推导出了显式界限。这项工作还将 Transformer 泛化与 Wasserstein 分布鲁棒优化联系起来。
-
新的机器学习方法回收用于优化问题的动态规划结果
研究人员开发了一种新颖的机器学习方法,该方法可以回收动态规划的计算结果来解决组合优化问题。这种基于水库计算的方法使用记录的动态规划结果作为线性回归的特征,从而辅助其他计算。在旅行商问题和子集和问题上进行测试时,与独立解决每个问题相比,这种多路复用技术显示出更高的近似精度和更短的计算时间。研究结果提出了一个新的计算范式,其中多个过程可以有效地共享和重用中间结果和状态。
-
机器学习加速硬件设计问题的SAT编码
研究人员开发了一个神经符号框架,以提高单常数乘法(SCM)问题的编码效率。该方法使用图神经网络来预测有效的运算符选择规则,显著减少了大型常数的编码时间和内存使用量。该方法在未见的17-32位常数上,编码时间减少了一到两个数量级,内存使用量减少了97%以上,同时保持了接近最优的编码质量。
-
将主动推理构建为凸马尔可夫决策过程,与强化学习统一
一篇新论文将主动推理(AIF)构建为凸马尔可夫决策过程(MDP),提出了一种将其与现代强化学习(RL)技术统一的方法。该研究认为,在AIF中最小化预期自由能(EFE)可以被视为潜在MDP中的策略优化,其中认知价值充当了表现性奖励。这种视角可以推导出一种与Actor-Critic方法和动态规划兼容的镜像下降算法,可能提供原则性的策略改进保证。
-
新的arXiv论文探讨基于风险的MDP和贝尔曼方程对偶
两篇新发表在arXiv上的研究论文探讨了人工智能序贯决策中的高级概念。第一篇论文介绍了ERQDP,一种在基于风险的目标下进行有限时间马尔可夫决策过程规划的新方法,它提供了一种无需枚举的方法,并提供认证解决方案或明确的剩余差距。第二篇论文深入研究了贝尔曼方程的理论基础,展示了其递推性质如何源于与状态动力学、回报分解和不确定性聚合相关的三个基本条件,统一了强化学习、控制和决策理论中的概念。
-
AI 问答探讨时间压力下的问题解决
该条目讨论了倒计时时钟如何影响问题解决,特别是在编程挑战的背景下。它涉及动态规划技术及其在诸如背包问题等领域的应用,这些都与面试准备相关。
-
新的RLVR方法微调推理模型用于能源存储控制
研究人员开发了一种名为基于验证器的强化微调(RLVR)的新颖方法,用于将开放权重推理模型适配到热能存储控制等复杂任务中。该技术使用动态规划生成可验证的奖励,然后用于微调GPT-5等模型。研究表明,RLVR在模拟办公楼的热能存储系统中显著减少了排放,使性能接近最优水平。研究结果表明,推理时的推理能力对于此类控制任务至关重要,而RLVR方法有望在能源管理领域得到更广泛的应用。
-
新的深度学习算法解决了高维动态规划问题
研究人员开发了一种名为确定性等价学习(CEL)的新型深度学习算法,用于解决具有递归效用的复杂高维动态规划问题。这种无网格、基于仿真的方法使用神经网络直接学习确定性等价值,无需状态转换的显式表示或可微性。CEL算法在各种金融应用中,包括鲁棒控制和资产配置,都对值函数和策略函数进行了准确的近似,贝尔曼误差在 1.0e-4 到 1.0e-3 的范围内。
-
新研究简化了马尔可夫决策过程中的最优策略
研究人员开发了一种理解结构化马尔可夫决策过程中最优策略的新方法。该研究提出了基于边界的策略近似方法,直接学习策略区域,这与传统逼近价值函数的方法形成对比。这种新方法将性能下降与动作边距联系起来,并解释了在临界边界附近的误差集中。在库存控制和队列接入方面的实验表明,与现有的强化学习基线相比,策略误差、价值差距和稳定性得到了改善。
-
强化学习数学系列继续讲解动态规划
本文是强化学习数学系列文章的第六部分。它侧重于动态规划,一种求解贝尔曼最优性方程的方法。作者指出,动态规划需要预先了解环境的动态。
-
研究人员将DP和CP结合用于调度问题
研究人员展示了一种新颖的混合方法,结合了动态规划(DP)和约束规划(CP)来解决部分车间调度问题(PSSP)。该方法使用DP作为主要的搜索框架,并将CP集成作为约束传播的子程序。混合模型提供了灵活性,能够适应任意的优先约束,并支持诸如大型邻域搜索之类的先进技术。
-
新理论保证 AI 模型蒸馏在优化中的成功
研究人员为组合优化任务中的知识蒸馏成功开发了一个理论框架。他们的工作侧重于训练一个较小的图神经网络 (GNN) 来模仿一个较大的模型,其中 GNN 的架构与特定问题的动态规划算法对齐。该研究提供了一个严格的条件,在该条件下,假设源模型具有由线性表示假设定义的足够丰富的特性,就可以有效地解决这种蒸馏过程。
-
AI安全认证被重构为分类问题,规避递归错误
研究人员开发了一个新颖的框架来认证动态系统的安全性,将其视为一个分类问题而非递归动态规划方法。这种新方法使用核嵌入直接估计T步安全概率,避免了传统方法中存在的复合误差,尤其是在更长的时间范围内。该框架统一了现有的方法,如屏障证书和鲁棒马尔可夫模型,能够对具有非马尔可夫动力学的系统进行安全认证,并展示了在不同认证范围内的稳定性。
-
新研究推动了对抗性模仿学习的理论与实践
两篇新论文探讨了对抗性模仿学习(AIL)的理论基础,这是一种使用神经网络从专家演示中学习的技术。第一篇论文介绍了OPT-AIL,一个旨在通过实现高效的在线学习和通用函数逼近来弥合AIL理论与实践之间差距的框架。第二篇论文分析了AIL在低样本量下的有效性,解释了它如何用最少的专家数据实现强大的性能,并在长规划视野中保持这种性能。
-
一项新的研究探讨了强化学习中用于控制任务的贝尔曼残差最小化方法
本文介绍了将贝尔曼残差最小化应用于马尔可夫决策问题策略优化的基础性研究成果。虽然动态规划更为常见,但贝尔曼残差最小化在函数逼近方面具有稳定的收敛性等优势。该研究侧重于将此方法扩展到控制任务,而控制任务的探索程度不如策略评估。