Proximal Policy Optimization (PPO)
PulseAugur coverage of Proximal Policy Optimization (PPO) — every cluster mentioning Proximal Policy Optimization (PPO) across labs, papers, and developer communities, ranked by signal.
-
量子机器学习框架增强器件建模
研究人员开发了一个新颖的强化学习框架,该框架利用紧凑的参数化量子电路(PQC)进行器件建模,特别是在数据有限的情况下。该框架采用通过近端策略优化进行优化的图神经网络策略来搜索最优电路架构。与经典基线相比,该方法表现出优越的性能,在氮化镓高电子迁移率晶体管(GaN HEMT)和纳米线FET(NWFET)方面均实现了显著更低的平均绝对误差和更紧密的批次变异性。这些发现突显了通过RL选择的经典模拟PQC作为器件数据集的有效替代方案的有效性,…
-
新研究探索深度强化学习在混合交通中安全网联自动驾驶车辆编队加入
一篇新研究论文提出了一个仿真框架,用于评估深度强化学习(DRL)算法在混合交通中网联自动驾驶车辆(CAV)编队加入操作。研究比较了深度Q网络(DQN)、双深度Q网络(DDQN)和近端策略优化(PPO),发现在其奖励函数中加入风险惩罚后,PPO的成功率达到98%,碰撞率低于1%。研究还强调了安全性、效率和决策速度之间的权衡,并指出外部安全控制器可以防止碰撞,但可能会降低整体效率。
-
新的误差扩散方法实现了生物学上可行的AI学习
研究人员开发了一种名为模数误差路由的新方法,用于将误差扩散(ED)扩展到符合Dale原则的生物学上可行的双流神经网络中。该方法能够有效地处理监督分类和强化学习任务中的信用分配问题。在MNIST数据集上,该方法实现了96.7%的准确率;在CIFAR-10分类任务上,基线准确率为61.7%;同时,与近端策略优化(PPO)结合时,在强化学习任务中也表现出有竞争力的性能。研究通过对不同数据集进行消融分析,揭示了信用分配中与任务相关的瓶颈。
-
具可解释性的AI框架优化建筑能源管理
研究人员开发了一个具可解释性的深度强化学习(XRL)框架,以优化住宅建筑的能源管理。该方法解决了传统深度强化学习的“黑箱”性质,增强了用户信任和实际应用。该框架使用合成数据和真实世界数据进行了测试,证明了其通过智能电池管理降低电费的能力,同时提供了决策过程的透明见解。
-
OpenAI 通过 Dota 2、安全性和泛化性推进强化学习
OpenAI 发布了一系列研究论文,详细介绍了强化学习方面的进展。其中包括 OpenAI Five 在 Dota 2 中取得超越人类的表现,开发了 RL 安全探索的基准,并使用 CoinRun 环境量化了泛化能力。该公司还探索了新颖的方法,例如基于预测的奖励以实现好奇心驱动的探索,学习多智能体系统中的策略表示,以及一种名为 Evolved Policy Gradients 的实验性元学习方法,以加快新任务的训练速度。进一步的研究解决了…