PulseAugur
实时 11:11:49

新研究增强了用于鲁棒强化学习和安全规划的扩散模型

研究人员正在开发新方法来提高扩散模型在强化学习和规划任务中的鲁棒性和安全性。一种方法是鲁棒正则化策略迭代(RRPI),它通过针对最坏情况动力学进行优化来解决转移不确定性,并在 D4RL 基准测试中表现出强劲的性能。另一组论文介绍了 Kolmogorov RegressionDiRecT 等技术,通过提高轨迹规律性来增强扩散策略,从而实现确定性故障检测,并在推理过程中强制执行安全约束,而不会过度约束采样过程。这些进展旨在使扩散模型在复杂的、长期的任务和安全关键型应用中更加可靠。 AI

影响 这些进展旨在提高人工智能系统在复杂决策任务中的可靠性和安全性。

排序理由 该集群包含多篇关于强化学习和扩散模型新算法的学术论文。

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 7 个来源。 我们如何撰写摘要 →

新研究增强了用于鲁棒强化学习和安全规划的扩散模型

报道来源 [7]

  1. arXiv cs.AI TIER_1 English(EN) · Zhengyi Guo, Wenpin Tang, Renyuan Xu ·

    硬约束下的条件扩散引导:一种随机分析方法

    arXiv:2602.05533v3 Announce Type: replace Abstract: We study conditional generation in diffusion models under hard constraints, where generated samples must satisfy prescribed events with probability one. Such constraints arise naturally in safety-critical applications and in rar…

  2. arXiv cs.AI TIER_1 English(EN) · Hongqiang Lin, Zhenghui Fu, Weihao Tang, Pengfei Wang, Yiding Sun, Qixian Huang, Dongxu Zhang ·

    过渡不确定性下的鲁棒正则化策略迭代

    arXiv:2603.09344v3 Announce Type: replace Abstract: Offline reinforcement learning (RL) enables data-efficient and safe policy learning without online exploration, but its performance often degrades under distribution shift. The learned policy may visit out-of-distribution state-…

  3. arXiv cs.AI TIER_1 English(EN) · Lekan Molu ·

    Kolmogorov Regression for Robust Diffusion Policies

    arXiv:2606.18186v1 Announce Type: cross Abstract: Finite-dimensional (FD) diffusion policies exhibit temporal drift owing to discretization artifacts that degrade long-horizon performance (when deployed on physical systems). We introduce a backward Kolmogorov equation that lifts …

  4. arXiv cs.AI TIER_1 English(EN) · Lekan Molu ·

    Kolmogorov Regression for Robust Diffusion Policies

    Finite-dimensional (FD) diffusion policies exhibit temporal drift owing to discretization artifacts that degrade long-horizon performance (when deployed on physical systems). We introduce a backward Kolmogorov equation that lifts diffusion policies to a Cameron-Martin space -- a …

  5. arXiv cs.LG TIER_1 English(EN) · Paolo Giaretta, Zeyang Li, Navid Azizan ·

    DiRecT:基于扩散的安全规划通过后退视界去噪

    arXiv:2606.15359v1 Announce Type: new Abstract: Diffusion models have emerged as powerful tools for planning and control by learning multimodal distributions over actions and trajectories. Yet reliable inference-time safety enforcement remains a key barrier to their deployment in…

  6. arXiv cs.AI TIER_1 English(EN) · Abhinav Agarwal, Adam Wei, Taylan Kargin, Michael Zeng, Cole Becker, Arif Kerem Dayi, Pablo Parrilo, Asuman Ozdaglar, Russ Tedrake ·

    使用长上下文长度训练和评估扩散策略

    arXiv:2606.16447v1 Announce Type: cross Abstract: Imitation learning has enabled highly-dexterous robotic manipulation from RGB observations. Policies trained with these methods, however, typically condition robot actions on only a short history of observations. These policies ca…

  7. arXiv cs.LG TIER_1 English(EN) · Haozhe Jiang, Haiwen Feng, Pieter Abbeel, Jiantao Jiao, Angjoo Kanazawa, Nika Haghtalab ·

    无漂移的扩散策略优化

    arXiv:2606.13795v1 Announce Type: new Abstract: RL post-training has become increasingly pivotal for improving diffusion policies, but existing diffusion policy-gradient methods are often unstable and cannot achieve reliable policy improvement. We identify the cause as the double…