实体
policy gradient algorithms
policy gradient algorithms
PulseAugur coverage of policy gradient algorithms — every cluster mentioning policy gradient algorithms across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
AI研究探索用于电动汽车车队充电的多智能体强化学习
这篇研究论文探讨了两种独立的强化学习多智能体方法,用于优化大型电动汽车车队的充电。该研究比较了上下文组合赌博机和策略梯度算法,模拟了基于价格信号和电量状态等本地信息做出充电决策的自主智能体。在各种拥堵水平和混合策略配置下,利用来自真实光伏生产数据的动态电价,对这些方法的性能进行了评估。
-
近端策略优化增强GFlowNet训练
研究人员引入了近端策略优化(PPO)作为训练生成流网络(GFlowNets)的新方法。该方法利用GFlowNets与熵正则化强化学习之间的联系来推导策略梯度算法。论文表明,与现有的GFlowNet训练目标相比,PPO在包括分子图生成在内的各种基准测试中,提供了更快的收敛速度和更高的数据效率。