Proximal Policy Optimization (PPO)
PulseAugur coverage of Proximal Policy Optimization (PPO) — every cluster mentioning Proximal Policy Optimization (PPO) across labs, papers, and developer communities, ranked by signal.
-
新的误差扩散方法实现了生物学上可行的AI学习
研究人员开发了一种名为模数误差路由的新方法,用于将误差扩散(ED)扩展到符合Dale原则的生物学上可行的双流神经网络中。该方法能够有效地处理监督分类和强化学习任务中的信用分配问题。在MNIST数据集上,该方法实现了96.7%的准确率;在CIFAR-10分类任务上,基线准确率为61.7%;同时,与近端策略优化(PPO)结合时,在强化学习任务中也表现出有竞争力的性能。研究通过对不同数据集进行消融分析,揭示了信用分配中与任务相关的瓶颈。
-
具可解释性的AI框架优化建筑能源管理
研究人员开发了一个具可解释性的深度强化学习(XRL)框架,以优化住宅建筑的能源管理。该方法解决了传统深度强化学习的“黑箱”性质,增强了用户信任和实际应用。该框架使用合成数据和真实世界数据进行了测试,证明了其通过智能电池管理降低电费的能力,同时提供了决策过程的透明见解。
-
OpenAI 通过 Dota 2、安全性和泛化性推进强化学习
OpenAI 发布了一系列研究论文,详细介绍了强化学习方面的进展。其中包括 OpenAI Five 在 Dota 2 中取得超越人类的表现,开发了 RL 安全探索的基准,并使用 CoinRun 环境量化了泛化能力。该公司还探索了新颖的方法,例如基于预测的奖励以实现好奇心驱动的探索,学习多智能体系统中的策略表示,以及一种名为 Evolved Policy Gradients 的实验性元学习方法,以加快新任务的训练速度。进一步的研究解决了…