PulseAugur
实时 13:56:08
实体 Proximal Policy Optimization

Proximal Policy Optimization

PulseAugur coverage of Proximal Policy Optimization — every cluster mentioning Proximal Policy Optimization across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
50
90 天内 188
发布 · 30天
0
90 天内 0
论文 · 30天
48
90 天内 179
层级分布 · 90 天
主题
关系
时间线
  1. 2026-05-26 research_milestone A new method is proposed to stabilize reinforcement learning training by strategically dropping transitions. 来源
情绪 · 30 天

20 天有情绪数据

最近 · 第 1/10 页 · 共 188 条
  1. TOOL · CL_216144 ·

    深度强化学习通过虚拟代理引导鱼群

    研究人员开发了一个深度强化学习框架,利用虚拟代理来引导鱼群。该系统采用近端策略优化(PPO)来训练策略,这些策略可以部署在现实世界的实验中,与活鱼互动。设计了一个复合奖励函数来平衡方向引导和群体凝聚力,实验表明白色背景和较大的刺激尺寸对引导最有效。研究还发现,引导效果随着群体规模的增大而降低,并且多个代理并未提高结果。

  2. TOOL · CL_216133 ·

    新的BIPPO方法提高了联邦学习的能效

    研究人员推出了一种新颖的多智能体强化学习方法BIPPO,旨在提高联邦学习服务的能效,特别是在物联网(IoT)系统中。BIPPO考虑了资源可用性和设备流失等基础设施限制,这在预算受限的环境中至关重要,从而解决了现有方法的局限性。所提出的解决方案在能耗最小的情况下提高了准确性,优于传统的联邦学习和其他强化学习技术,并且在客户端数量不断增加的情况下仍表现出稳定性和可扩展性。

  3. TOOL · CL_212128 ·

    量子电路研究探索自适应测量放置

    研究人员探索了受监控量子电路中的自适应测量放置,超越了随机放置,以研究其对纠缠相变的影响。通过固定测量预算和改变放置策略,他们发现与随机放置相比,确定性连续扫描显著降低了半切熵。这表明空间顺序,而不仅仅是测量速率,在量子动力学中观察到的相变中起着至关重要的作用。

  4. RESEARCH · CL_210264 ·

    Pairwise ranking beats RL for LLM explanation selection in recommendation systems

    研究人员开发了一种从大型语言模型(LLM)中选择推荐系统解释的新方法,显著降低了服务成本和延迟。通过预先生成解释池并使用驻留在CPU上的选择器,该系统无需GPU即可在100毫秒内响应。研究发现,成对学习排序方法(特别是LambdaRank)在选择最佳解释方面优于单动作强化学习方法,在基准数据集上取得了更高的F1分数。

  5. RESEARCH · CL_208598 ·

    新方法增强机器人领域 VLA 策略的效率和鲁棒性 · 跟踪 4 个来源

    研究人员开发了新方法来提高机器人领域视觉-语言-动作 (VLA) 策略的效率和鲁棒性。一种方法 EXIMO 使用视觉-语言模型 (VLM) 作为规划器,将复杂任务分解为更小的步骤,从而实现更高效的微调和数据收集。另一种方法 GS-VLA 采用高斯溅射技术,在无需重新训练的情况下使冻结的 VLA 策略适应视角变化,显著提高了性能鲁棒性。此外,Prism-GRPO 通过纳入轨迹级别的执行质量分数来增强策略优化,减少了对大量机器人滚动的需求…

  6. TOOL · CL_207861 ·

    ClawGym II 框架通过异构组合器增强 AI 代理训练

    一篇新论文介绍了一个名为 ClawGym II 的框架,该框架旨在通过利用 OpenClaw 和 Claude Code 等现有工具来训练 AI 代理。该系统捕获与这些工具的交互,并将它们组织成前缀树,以使用近端策略优化 (PPO) 和 GRPO 来优化模型。研究表明,使用 OpenClaw 可使 Qwen3-30A3B 模型的 Pass@1 分数提高 9.98 分,使用 Claude Code 可提高 14.81 分。此外,该研究还…

  7. TOOL · CL_206473 ·

    新的量子反馈控制方法使用物理信息神经网络记忆

    研究人员开发了一种名为 Kraus-Parameterized Belief Reinforcement Learning 的新方法,用于量子反馈控制。该方法使用一个约束在 Stiefel 流形上的循环编码器来生成物理上始终有效的精确密度矩阵估计。然后,一个 Proximal Policy Optimization 演员利用这些信念状态来指导连续控制动作。在模拟中,该方法证明了对受监控量子比特的稳定反馈控制,实现了约 0.77-0.8…

  8. TOOL · CL_206430 ·

    新AI框架教自动驾驶汽车进行伦理决策

    研究人员开发了一个“伦理决策头”(EDH)框架,利用深度强化学习赋予自动驾驶汽车伦理推理能力。EDH框架将伦理原则编码为可微分的奖励信号,使代理能够学习符合道德的驾驶行为。在CARLA模拟环境中评估了两种规范框架:功利主义和康德主义,训练利用了近端策略优化和基于人类偏好的Bradley-Terry奖励模型。值得注意的是,人类评分者偏好自我牺牲而非最小化伤亡,模型学习到了这种偏好,表明理论伦理处方与实际人类奖励之间存在差异。

  9. TOOL · CL_206219 ·

    AI框架利用大型语言模型和强化学习优化无人机物流

    研究人员开发了一个自主AI框架,用于优化云制造环境中无人机(UAV)的物流调度。该框架集成了大型语言模型和思维链推理,将用户输入转化为复杂问题的数学公式,该问题将物理产品收集与计算任务调度相结合。采用一种分层深度强化学习方法,特别是近端策略优化(PPO),来管理无人机路线规划和任务执行,在模拟中展示了99.6%的产品收集率和100%的截止日期满意度。

  10. TOOL · CL_205983 ·

    新框架增强了自动驾驶汽车的行人路径预测能力

    研究人员开发了一个新的行人路径预测框架,这对于自动驾驶汽车和驾驶员辅助系统的安全至关重要。该方法改编了时空图注意力网络(STGAT),并引入了针对STGAT定制的特定状态和动作定义。该框架支持各种策略类型和决策场景,并利用REINFORCE和近端策略优化等强化学习算法。实验表明,与标准的监督学习方法相比,这些重新制定的学习任务在基准数据集上提高了预测性能,这表明优化决策过程和训练目标可以改进先进的预测架构。

  11. TOOL · CL_205893 ·

    新型 LLM 代理 SKILL 采用多模型方法优化逻辑综合

    研究人员开发了 SKILL,这是一种利用多个大型语言模型和强化学习来优化逻辑综合的新型代理。该系统采用 GPT-4o 进行战略规划,Claude Sonnet 4 进行详细推理,以及 Gemini 2.5 Pro 和基于 PPO 的 RL 代理与综合工具进行交互。SKILL 包含一个自纠正模块来监控反馈并实施恢复策略,在基准测试中比现有的专家流程提高了 12.4%。

  12. RESEARCH · CL_206648 ·

    新的RL框架可在全切片图像上实现快速肿瘤分割

    研究人员开发了一种新颖的端到端强化学习框架,用于直接在全切片图像(WSIs)上分割肿瘤。该方法将WSI视为一个交互式、分层的环境,允许AI代理导航、缩放和选择肿瘤区域。该系统使用Proximal Policy Optimization (PPO) 和 actor-critic 架构进行训练,实现了与传统基于块的方法相当的分割质量,同时将每张幻灯片的推理时间显著缩短至仅几秒钟。这种方法有望推动RL在计算病理学中的应用。

  13. TOOL · CL_204108 ·

    AI框架为机器人探索稀疏化动态图

    研究人员开发了一种新颖的基于Transformer的框架,该框架利用近端策略优化(Proximal Policy Optimization)来稀疏化机器人探索中的动态图。该方法旨在减轻这些图的计算负担和内存占用,这些图对于基于前沿的探索和路径规划等任务至关重要。该框架在模拟中进行了测试,结果显示图的大小显著减小了高达96%,同时保持了有效和可泛化的探索能力。

  14. TOOL · CL_204084 ·

    CORAL系统通过基于课程的强化学习推进自动驾驶

    研究人员开发了CORAL,这是一种用于增强自动城市驾驶强化学习的新方法。CORAL利用一个课程,该课程逐步增加路线长度和行为约束,并配有一个阶段感知奖励系统,该系统根据任务难度调整其权重。该方法使用紧凑的状态表示在CARLA模拟器中进行训练,在目标实现和路线完成方面显著优于标准的Proximal Policy Optimization基线,并展示了对未见过的城市环境的强大的零样本可迁移性。

  15. TOOL · CL_204052 ·

    AI 方法通过 98.43% 的生存率提升电网稳定性

    研究人员开发了一种受 AlphaZero 启发的蒙特卡洛树搜索 (MCTS) 方法,用于电力网络的自主拓扑控制。该方法旨在管理拥堵并维持电网稳定,尤其是在可再生能源整合日益增加的情况下。研究发现,优化的 AlphaZero 方法达到了 98.43% 的峰值生存率,优于近端策略优化 (PPO) 变体。关键发现表明,使用简单的二元生存奖励和受限的线路负荷观测空间,在没有先验策略或价值函数指导的情况下,可以提高训练效率和有效性。

  16. TOOL · CL_204037 ·

    新框架对动态车辆路径规划问题进行AI基准测试

    研究人员为动态多仓库车辆路径规划问题开发了一个事件驱动的学习和基准测试框架。该框架利用通过行为克隆和近端策略优化训练的Transformer和Masked MLP策略。虽然学习到的策略能够处理复杂场景并无需重新训练即可迁移到更大的实例,但在路径质量、等待时间和稳定性方面,它们并未优于最强的启发式方法。

  17. TOOL · CL_203989 ·

    新的DRL框架使用LLM来改善无人机辅助VANET的连接性

    研究人员开发了一个语义增强深度强化学习(SA-DRL)框架,以改善城市车辆自组网(VANETs)中的网络连接性。该框架利用无人机(UAVs)作为移动中继,并结合大型语言模型(LLM)通过对基于道路拓扑的网络碎片化进行建模来指导学习过程。提出的SA-PPO算法提高了探索效率,与传统的PPO方法相比,在车辆连接性、连通分量大小方面取得了显著改进,并降低了UAV的能耗。

  18. TOOL · CL_203894 ·

    强化学习应用于工业生产调度

    研究人员开发了一种用于复杂工业涂装场景生产调度的强化学习(RL)方法。利用开源的数字模型游乐场(DMPG)进行模拟,该研究将深度Q网络和近端策略优化与传统方法进行了基准测试。研究结果表明,基于RL的调度在关键绩效指标方面提供了均衡的改进,其中近端策略优化显示出最一致的结果。这项工作旨在通过在现实、可共享的环境中验证这些方法,来弥合学术RL研究与实际工业应用之间的差距。

  19. RESEARCH · CL_208203 ·

    WONDER框架利用无线世界模型优化多智能体无人机覆盖

    研究人员开发了WONDER,一个新颖的框架,用于在地面基础设施受损的情况下,通过多智能体无人机(UAV)优化覆盖。WONDER利用基于联合嵌入预测架构(JEPA)的无线世界模型来预测潜在无人机轨迹对无线覆盖的影响。这种基于模型的方法促进了一个博弈过程,其中提案被排序并按顺序提交,从而在局部观测能力有限的情况下确保最优的群体覆盖。该框架在RadioDynamics仿真环境中进行了测试,取得了高平衡分数,并优于其他方法。

  20. TOOL · CL_199871 ·

    探索用于LLM推理的高级强化学习技术

    本文深入探讨了用于大型语言模型(LLM)的高级强化学习技术,重点关注增强推理能力的方法。文章探讨了Grpo(广义近端策略优化)、过程奖励模型和无批评者强化学习,强调了它们在实现新水平AI性能方面的作用。文章强调了步级监督和可验证的奖励函数是未来AI进步的关键驱动力。