Reinforcement Learning with Human Feedback
PulseAugur coverage of Reinforcement Learning with Human Feedback — every cluster mentioning Reinforcement Learning with Human Feedback across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Apple 研究人员发布 DACA-GRPO 以改进扩散语言模型
Apple 机器学习研究部推出 DACA-GRPO,一种用于增强扩散语言模型强化学习的新颖方法。该方法通过结合时间信用分配和减少似然估计中的偏差来解决现有强化学习技术的局限性。DACA-GRPO 在包括数学推理、代码生成和约束满足在内的各种基准测试中取得了显著的性能提升。
-
新的GRPO变体旨在改善LLM与多样化偏好的对齐
两篇新研究论文介绍了用于将大型语言模型(LLM)和视觉语言模型(VLM)与多样化用户偏好对齐的组相对策略优化(GRPO)框架的变体。第一篇论文《个性化GRPO》(P-GRPO)通过将优势估计与批次统计解耦,解决了标准GRPO压制少数派偏好的问题,从而实现了更快的收敛和与异构信号更好的对齐。第二篇论文《受限GRPO》通过使用基于拉格朗日的方法并将标准化优势标量化而非奖励,将GRPO扩展到安全关键领域,从而提高了约束依从性和稳定性。
-
新框架利用机器学习遗忘实现成本高效的大语言模型偏好对齐
研究人员开发了一个新框架,将机器学习遗忘技术与大语言模型(LLMs)的偏好对齐相结合。该方法旨在降低传统方法(如基于人类反馈的强化学习 RLHF)的成本和计算强度,后者需要大量的正偏好数据。所提出的名为 Unlearning to Align (U2A) 的方法,通过使用双层优化来选择和加权负面示例,以实现高效地移除负面示例的影响,从而达到最佳性能。实验已证实 U2A 在改善偏好对齐方面的有效性。
-
机器人Pepper通过ChatGPT和RLHF学习富有表现力的手势
研究人员开发了一种新颖的方法,通过整合ChatGPT和基于人类反馈的强化学习(RLHF)来为人形机器人Pepper生成自然且富有表现力的手势。单独使用ChatGPT的初步尝试产生了僵硬的动作,但随后基于用户评估的RLHF微调显著改善了机器人的手势生成。这个迭代过程产生了更流畅、更相关、更富表现力的手势,增强了人机交互。
-
Hugging Face论文探讨RLHF标注的三种模型
一篇新论文提出了三种不同的模型来理解人类标注者在人类反馈强化学习(RLHF)流程中的作用。这三种模型是“延伸”,即标注者模仿设计者的判断;“证据”,即标注者提供事实信息;以及“权威”,即标注者代表更广泛的人群观点。该论文认为,明确不同标注任务使用的模型可以改进RLHF流程设计和聚合方法。
-
论文区分了RLHF标注的三种模型:延伸、证据和权威
一篇新论文提出了三种不同的模型,用于说明人类标注者的判断如何通过人类反馈强化学习(RLHF)来塑造大型语言模型的行为。这三种模型是:“延伸”,即标注者与设计者的观点保持一致;“证据”,即标注者提供事实信息;以及“权威”,即标注者代表更广泛的社会共识。该论文认为,RLHF流程应根据这些不同的角色进行定制,而不是采用单一的统一方法。