Proximal Policy Optimization
PulseAugur coverage of Proximal Policy Optimization — every cluster mentioning Proximal Policy Optimization across labs, papers, and developer communities, ranked by signal.
- instance of reinforcement learning 90%
- instance of Grpo 90%
- instance of Pfadfinder und Pfadfinderinnen Österreichs 90%
- used by unmanned aerial vehicle 90%
- instance of TD3 90%
- used by MuJoCo 90%
- developed Advantage Actor-Critic 90%
- used by long short-term memory 90%
- used by deep reinforcement learning 80%
- used by reinforcement learning 70%
- used by DagsHub 70%
- used by alphaXiv 70%
16 天有情绪数据
-
在随机环境中,基于学习的运动规划优于经典方法
一篇新发表在arXiv上的研究论文,对比了在动态危险场中经典运动规划方法与基于学习的方法。研究发现,经典规划器在确定性环境中表现良好,成功率和路径质量高,但规划时间有时较长。然而,在具有不确定障碍物动态的随机环境中,基于Proximal Policy Optimization (PPO)的策略在延迟、成功率和路径质量方面始终优于经典方法。
-
NVIDIA 训练 AI 代理从关键性错误中恢复
NVIDIA 研究人员与普林斯顿大学和马里兰大学合作,开发了 PivotOPD,一种新颖的多轮 AI 代理训练方法。该技术教会代理识别并从可能导致任务失败的关键早期错误中恢复。PivotOPD 在 ALFWorld、WebShop 和基于搜索的问答等多个基准测试中表现出卓越的性能,在应用于 Qwen3 和 Nemotron-3.5-SFT 等模型时,优于其他 13 个基线。
-
人工智能优化交通信号,减少延误和排放
研究人员开发了一个强化学习(RL)系统,用于优化城市交叉口的交通信号控制,特别是在支持物联网的环境中。该系统利用近端策略优化(PPO),根据当地交通状况动态调整绿灯时长,而无需预测未来的需求。在科威特的模拟显示,与固定时间控制相比,平均车辆延误显著减少(46%),二氧化碳排放量也减少了23%,这预示着智慧城市交通的潜力。
-
新分析为 PPO-Clip 调优提供理论指导
研究人员开发了一种新的近端策略优化(PPO)与剪辑(PPO-Clip)的非渐近收敛性分析,将其视为一个闭环演员-评论家系统。该分析考虑了评论家学习、剪辑和回放重用等因素,为策略平稳性和评论家跟踪准确性提供了理论保证。研究结果为 PPO-Clip 的调优提供了指导,并建议在某些配置下具有多项式样本复杂度。
-
新框架利用人工智能实现污水基础设施的自愈
研究人员开发了HydroSphere,一个旨在通过先进的数据驱动技术增强污水基础设施管理的新型框架。该系统集成了用于预测水质的TCN-LSTM模型、用于自适应化学加药的Proximal Policy Optimization (PPO)以及用于异常检测的深度自动编码器(SHADE)。HydroSphere旨在提高污水处理的效率和安全性,并与联合国可持续发展目标6和13保持一致。
-
新MoRE框架增强了基于语言的轨迹预测模型
研究人员开发了MoRE,一个旨在增强基于语言的轨迹预测模型的新型框架。MoRE使用强化学习将数值预测先验知识整合到现有的语言模型中,利用五个固定的数值预测器提供坐标级别的运动和交互知识。该方法通过将语言模型的上下文理解与数值专家的精确反馈相结合来优化预测,特别关注困难的预测案例。该框架在ETH-UCY等基准数据集上显示出显著的准确性提升,在保持推理效率的同时降低了预测误差。
-
AI控制器在提高电动汽车能效方面展现出潜力
一篇新的研究论文比较了四种不同的电动汽车控制策略,重点关注能效和路径跟踪。该研究使用包含再生制动的已验证能源模型,评估了非线性模型预测控制(NMPC)、近端策略优化(PPO)、PID-SF基线和Stanley几何基线。研究结果表明,在更简单赛道上训练的PPO控制器可以有效地迁移到更复杂的车辆模型和未见过的场景,证明了其适应性和延长电动汽车续航里程的潜力。
-
更简单的风模型提高了四旋翼飞行控制的鲁棒性
研究人员调查了风场保真度对使用Proximal Policy Optimization (PPO) 训练的四旋翼飞行控制策略鲁棒性的影响。该研究比较了从无风条件到复杂大涡模拟场的五种扰动级别,发现一种更简单的训练方法——离散阵风域随机化——在各种风速下表现最佳。研究结果表明,控制能力而非风的真实性是限制鲁棒性的主要因素,这表明在风场保真度方面的投入应与平台对风的敏感度保持一致。
-
在模拟MOBA世界中训练的AI代理在真实游戏中获胜率达到70%
研究人员开发了一种新颖的方法,通过利用连续的Dyna循环来训练AI代理以应对复杂游戏。该方法仅在十人英雄多人在线战术竞技游戏(MOBA)的已学习世界模型中训练策略,真实游戏仅用于为世界模型更新和策略评估提供数据。训练好的策略在实际游戏中获胜率达到70.2%,与仅在想象中训练的零胜率相比有了显著提高。关键发现表明,模型利用难以在模拟环境中进行评估,并且在策略自身游戏场景下,在训练数据上准确的世界模型可能不准确,因此需要Dyna循环进行修复。
-
研究发现:AI模型陷入“泛化陷阱”
本文详细介绍了多奖励强化学习基准测试的第二部分,重点关注不同算法在未见任务上的表现。研究使用Qwen3-14B模型在一个去中心化交易所套利环境中测试了七种强化学习算法,包括CISPO和DAPO。结果显示,尽管CISPO在训练中获得了高奖励,但在冻结测试任务上的表现却显著低于未经训练的基线模型,这揭示了一个潜在的“泛化陷阱”,即训练指标可能具有误导性。
-
新研究提出AI泛化差距标准化指标
一篇新的arXiv论文提出了一种衡量强化学习中泛化差距的标准化方法,特别是在ProcGen环境中。作者认为,报告的泛化差距应与“随机基线”进行比较——即随机策略在相同关卡上的表现。他们的分析使用Proximal Policy Optimization (PPO)在八个ProcGen环境中进行,结果显示这种比较显著改变了标准指标的解释。该论文还强调了测试时动作采样和评估方面存在的问题,并指出许多当前实现可能无法准确反映真实的策略性能。
-
新的 T5 方法通过双评论员增强语言模型学习
研究人员开发了一种名为 T5(或双评论员训练)的新方法,以改进语言模型在强化中期训练中学习内部思维的方式。该技术解决了在 Token 级别分配信用方面的挑战,这对于从无标签文本中进行有效学习至关重要。T5 利用两个评论员,就单个生成轨迹的 Token 级别优势提供校准反馈,旨在减少更新漂移并保留学习信号。实验表明,与现有方法相比,T5 显著提高了基准性能并缩短了训练时间。
-
强化学习在复杂的金融交易动态中面临挑战
研究人员探索了近端策略优化(PPO),一种强化学习算法,在具有分析求解动态的连续时间经纪人-交易者博弈中的应用。他们发现,虽然PPO在简单条件下可以近似最优策略,但在涉及随机订单流的复杂场景中却举步维艰。研究还表明,分析解可以作为诊断RL性能的宝贵基准,并作为策略适应的有效起点。
-
新的“Follow the Winners”算法增强了LLM的强化学习
研究人员推出了一种名为“Follow the Winners”(FTW)的新型无批评者强化微调算法,专为代理式大型语言模型(LLM)设计。与依赖于有状态环境中不切实际的重复回滚的现有GRPO风格方法不同,FTW使用回放缓冲区样本上的序数滤波器来适应交叉熵方法。这种方法允许回报的顺序统计量具有多项式集中性,使其适用于无法进行重复回滚的场景。在代理式LLM的后训练中,FTW在Sokoban和Search-R1基线上表现出与GRPO和PPO…
-
机器人框架通过信息丰富的数据收集弥合仿真到现实的差距
研究人员开发了一种新颖的 Real-Sim-Real (RSR) 框架,以解决机器人领域持续存在的仿真到现实差距问题。该框架包含一个信息论成本函数,该函数平衡了任务完成度和收集对改进策略转移最有用的真实世界样本。RSR 循环可以与现有的强化学习算法集成,并提供灵活性,将可微分仿真视为可选。当有可微分模拟器可用时,收集到的数据还可以用于微调模拟器参数。该框架已在 6 自由度机械臂的操作任务和腿式机器人的运动任务上进行了演示,显示出提高的…
-
DashVMC 学习几何冲刺的实时控制模型
研究人员开发了 DashVMC,一个用于在游戏几何冲刺中学习实时控制的离散世界模型的系统。通过大约两小时的游戏数据进行训练,DashVMC 可以在无需与实时游戏进一步交互的情况下预测游戏状态并执行操作。使用行为克隆初始化并使用近端策略优化进行精炼的控制器在游戏玩法中表现出改进的性能,在消费级硬件上保持了 60 赫兹的捕获到动作循环。
-
新AI策略PPO-HRAP改进风险控制交易
研究人员开发了PPO-HRAP,这是一种将近端策略优化与状态感知方法相结合的新型交易策略,以更好地管理风险。这种混合策略旨在平衡捕捉上涨潜力和控制回撤,这是强化学习在交易中面临的常见挑战。PPO-HRAP在SPY测试窗口上表现强劲,实现了27.62%的总回报,并与买入并持有策略相比显著降低了最大回撤。
-
将大型语言模型置于经济模拟器中以生成政策
研究人员开发了一种将大型语言模型 (LLM) 置于动态随机一般均衡 (DSGE) 模拟器中的方法,以生成和预测经济政策。该方法通过将一个经过指令调整的语言模型置于六个 DSGE 模拟器中来测试 LLM 生成的政策是否与经济动态一致。该模型观察经济状态和讨论,选择政策行动,并接收奖励,从而产生一个长期信用分配问题,Proximal Policy Optimization (PPO) 通过学习到的价值函数来解决。
-
新纠错方法提升PPO样本效率
研究人员开发了一种新方法来提高Proximal Policy Optimization (PPO)等策略改进算法的样本效率。通过引入一个考虑状态访问分布偏差的纠错项,该方法可以在复杂的信用分配任务上实现更快的学习。这种纠错在特定的历史注入动力学下是精确的,并且可以通过单个参数进行调整,从而提供偏差-方差权衡。
-
新的“代码即控制”方法为实时人工智能任务合成 Python 控制器
研究人员开发了一种名为“代码即控制”的新方法,该方法可为实时人工智能控制任务合成 Python 控制器。该方法将由 LLM 生成的控制器结构与其通过无导数搜索优化的参数分开。生成的控制器直接作为策略执行,无需在决策时进行 LLM 推理或规划,从而能够比传统的近端策略优化等方法更快地选择动作。“代码即控制”在各种 Atari 游戏、Flappy Bird 和 MuJoCo 任务中表现出色,与深度强化学习相比具有竞争力,同时所需的交互更少…