Hierarchical reinforcement learning and decision making
PulseAugur coverage of Hierarchical reinforcement learning and decision making — every cluster mentioning Hierarchical reinforcement learning and decision making across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的HRL模型使用基于流的生成模型增强训练
研究人员开发了一种新颖的分层强化学习(HRL)模型,该模型利用基于流的深度生成模型(FDGM)来提高训练效率。这种新方法通过利用FDGM的逆运算,实现了直接的离策略校正,使更高级别的策略能够更准确地捕捉更低级别策略的能力。在基准环境上的实验表明,该方法在具有高维状态和动作空间以及稀疏奖励的复杂场景中优于现有模型。
-
新方法增强了分层强化学习任务的安全性
研究人员开发了一种新颖的方法来增强分层强化学习的安全性,特别是在复杂、长时限的任务中。该方法利用学习到的世界模型,结合用于生成子目标的高层策略和采用想象性回滚来防止不安全行为的低层策略。与具有挑战性的导航和操作任务上现有的安全强化学习基线相比,该技术显著提高了成功率并确保了一致的约束满足。
-
新算法CARL增强分层强化学习中的技能可复用性
研究人员开发了一种名为CARL(对比动作表示用于可复用局部控制)的新算法,以提高分层强化学习(HRL)中技能的可复用性。CARL利用局部动力学的规律性,表明在不同的全局环境中,相似的动作序列对于状态转移是必需的。通过将这些环境与其所需的动作序列对齐,该算法学习在哪里以及复用哪些技能,可能使各种HRL算法受益。该方法在复杂环境中展示了定性的技能聚类,并在与HIQL集成后,在OGBench基准测试中提高了性能。
-
量子电路增强分层强化学习智能体,节省参数
研究人员开发了一种混合分层强化学习智能体,将变分量子电路集成到其架构中。该方法使用量子电路替代经典组件,用于特征提取和策略估计等任务。评估表明,量子特征提取器可以提高性能,同时显著减少可训练参数的数量,尽管量子选项值估计存在架构挑战。