Trust Region Policy Optimization
PulseAugur coverage of Trust Region Policy Optimization — every cluster mentioning Trust Region Policy Optimization across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新研究为自然策略梯度算法提供有限时间收敛保证
一篇新发表在arXiv上的研究论文首次为有限时间马尔可夫决策过程中的自然策略梯度(NPG)算法提供了有限时间收敛保证。该研究在恒定步长和递增步长两种情况下分析了NPG,证明了恒定步长下的次线性收敛率和递增步长下的线性收敛率。这些发现对强化学习具有重要意义,因为NPG是Trust Region Policy Optimization和Proximal Policy Optimization等流行方法的基础。
-
新的TPOUR方法增强了无监督文档检索中的时间相关性
研究人员开发了一种新颖的无监督稠密检索器训练方法TPOUR,解决了跨越多个时间段的文档集合中的时间相关性挑战。时间检索偏好优化(TRPO)技术指导检索器偏好时间对齐的文档,即使没有明确的时间戳。TPOUR在现有无监督和有监督基线方面取得了显著改进,与规模大得多的Qwen-Embedding-8B模型相比,nDCG@5有了显著提高,尽管其规模要小得多。
-
OpenAI发布Proximal Policy Optimization,实现更简单、有效的强化学习
OpenAI发布了Proximal Policy Optimization (PPO),这是一种新的强化学习算法,其性能可与现有方法媲美或更优,同时实现更简单的实现和调优。PPO在易用性、样本效率和超参数调优之间取得了平衡,使其成为深度神经网络控制任务的宝贵工具。该版本包括使用TensorFlow和MPI的可扩展、并行Python 3实现,以及提供显著速度提升的GPU版本PPO2。
-
OpenAI及研究人员揭示AI在对抗性攻击下的脆弱性
OpenAI的研究人员正在探索神经网络中对抗鲁棒性在不同类型扰动间的迁移性。他们的研究结果表明,针对一种扰动类型的鲁棒性并不总是能保证对其他扰动类型的鲁棒性,有时甚至可能适得其反。他们建议使用多种类型的扰动和不同大小的扰动来评估对抗性防御,以确保全面的安全性。此外,OpenAI正在将对抗性样本作为一个具体的AI安全问题进行研究,并指出它们可能导致严重问题,例如欺骗自动驾驶汽车。