PulseAugur
实时 17:58:50
实体 HH-RLHF

HH-RLHF

PulseAugur coverage of HH-RLHF — every cluster mentioning HH-RLHF across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. RESEARCH · CL_154008 ·

    强化学习研究探索加速、验证和基础模型 · 跟踪 9 个来源

    近期多篇 arXiv 论文探讨了强化学习 (RL) 的进展和理论基础。其中一篇论文研究了随机重置如何通过改进奖励信息传播来加速 RL,使其超越随机搜索,即使在复杂的基于神经网络的任务中也是如此。另一篇综述统一了验证 RL 策略的现有方法,这对于安全关键型应用至关重要。进一步的研究深入探讨了基础模型、多智能体系统的 RL,并为可泛化的真实世界 RL 任务引入了一个大规模基准。此外,还提出了用于在实际迁移约束下优化 RL 和处理大型推理模…

  2. TOOL · CL_21988 ·

    新的 Pair-GRPO 算法增强了 LLM 对齐的稳定性和泛化能力

    研究人员引入了 Pair-GRPO 系列,这是一个新颖的理论框架,旨在增强用于对齐大型语言模型(LLM)的强化学习(RL)的稳定性和通用性。该系列包含两个变体:Soft-Pair-GRPO 和 Hard-Pair-GRPO,它们通过优化奖励信号和引入显式策略约束,解决了当前成对偏好学习方法的局限性。在标准的 LLM 对齐基准和连续控制任务上的实验表明,Pair-GRPO 在对齐质量和训练稳定性方面始终优于现有方法。