实体
meta-reinforcement learning
meta-reinforcement learning
PulseAugur coverage of meta-reinforcement learning — every cluster mentioning meta-reinforcement learning across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 3 条
-
拟蒙特卡洛初始化提升元强化学习训练收敛性
研究人员研究了使用拟蒙特卡洛(QMC)方法初始化元强化学习模型。他们的发现表明,在与基线任务相似的连续控制环境中,QMC初始化可以改善训练收敛性。然而,对于不相似的任务,传统的正交初始化在无偏搜索方面被证明更有效。
-
元强化学习框架利用进化进行供应链优化
研究人员开发了一种新颖的元强化学习框架,该框架利用进化搜索来改进复杂组合问题(如供应链管理)中的多目标优化。该方法维护一个元策略种群,每个策略都通过基于梯度的方法进行训练,并通过进化技术进行优化。该框架在具有经济、环境和社会目标的供应链场景中进行了测试,通过生成更多样化且分布更佳的帕累托前沿近似、增强跨任务适应性以及与现有方法相比在超体积和豪斯多夫距离方面取得显著改进,从而展示了卓越的性能。
-
GLiBRL通过可处理推理和更好的泛化能力推动深度贝叶斯强化学习发展
研究人员开发了GLiBRL,一种新颖的贝叶斯强化学习方法,通过明确纳入贝叶斯任务参数来增强泛化能力。该方法通过对任务参数和模型噪声进行完全可处理的贝叶斯推理,克服了先前深度BRL技术的局限性。GLiBRL与各种强化学习算法无缝集成,并在MuJoCo和MetaWorld基准测试中展示了最先进的性能提升。