实体
HalfCheetah-v4
HalfCheetah-v4
PulseAugur coverage of HalfCheetah-v4 — every cluster mentioning HalfCheetah-v4 across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新研究探索用于智能体生存、导航和可解释性的高级强化学习 · 跟踪 7 个来源
研究人员正在探索强化学习(RL)的高级技术,以增强智能体的性能和可解释性。一项研究提出了程序化策略(PERL)作为进化 RL 中神经策略(NERL)的替代方案,证明了 PERL 更高的生存率。另一篇论文侧重于使用 RL 进行自主机器人的流感知导航,发现使用速度和记忆传感器训练的智能体优于那些具有显式全局流参数的智能体。此外,正在开发新的方法来解释 RL 智能体,例如使用归纳逻辑编程(ILP)为策略可解释性创建客观指标,以及一种称为 S…
-
新的 Pair-GRPO 算法增强了 LLM 对齐的稳定性和泛化能力
研究人员引入了 Pair-GRPO 系列,这是一个新颖的理论框架,旨在增强用于对齐大型语言模型(LLM)的强化学习(RL)的稳定性和通用性。该系列包含两个变体:Soft-Pair-GRPO 和 Hard-Pair-GRPO,它们通过优化奖励信号和引入显式策略约束,解决了当前成对偏好学习方法的局限性。在标准的 LLM 对齐基准和连续控制任务上的实验表明,Pair-GRPO 在对齐质量和训练稳定性方面始终优于现有方法。