实体
Gaussian policy
Gaussian policy
PulseAugur coverage of Gaussian policy — every cluster mentioning Gaussian policy across labs, papers, and developer communities, ranked by signal.
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新框架通过流匹配和安全约束增强机器人策略 · 跟踪 4 个来源
研究人员开发了几个新的框架来改进强化学习中的基于流的策略,特别是在机器人领域。这些方法旨在解决多模态动作分布和需要安全、符合约束的动作等挑战。诸如基于精炼的流策略优化 (RFPO) 和 OptiFlow 等技术利用值引导和最优传输来更好地表示复杂的动作空间并避免模式崩溃。另一种方法,值引导流匹配 (VGFM),将值引导直接集成到流匹配过程中,而无需复杂反向传播。此外,ActSafeGuard 引入了一个可微分的安全卫士层,以确保机器人…
-
新的NFTR方法通过避免模式崩溃改进离线目标条件RL
研究人员推出了一种新颖的离线目标条件强化学习方法NFTR(Normalizing Flows subgoal policies with Triangle-slack Reweighting)。NFTR通过使用条件归一化流(conditional Normalizing Flow)替换标准高斯策略,从而避免模式崩溃,解决了现有分层隐式Q学习(HIQL)的局限性。此外,它还引入了三角松弛分数(triangle slack score)来…