Nash Learning from Human Feedback
PulseAugur coverage of Nash Learning from Human Feedback — every cluster mentioning Nash Learning from Human Feedback across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的MNPO框架增强了LLM与复杂人类偏好的对齐
研究人员推出了一种名为多人纳什偏好优化(Multiplayer Nash Preference Optimization, MNPO)的新框架,旨在提高大型语言模型与复杂人类偏好的对齐度。与以往仅限于双人交互的方法不同,MNPO将对齐过程推广到n人博弈,允许策略在与一群对手竞争的同时,朝着参考模型进行正则化。这种方法旨在捕捉更真实、更多样化的偏好结构,包括简单基于奖励的方法通常会忽略的非传递性和异质性。实证评估表明,MNPO在指令遵循…
-
新方法在无需大量微调的情况下使大型语言模型与用户偏好保持一致 · 跟踪 3 个来源
研究人员开发了两种新颖的方法,可以在无需大量参数更新的情况下使大型语言模型(LLM)与用户偏好保持一致。一种方法称为“规范学习”(spec learning),它使用简短的用户指令和少量偏好判断来创建自然语言提示,在推理时指导 LLM。这种方法提供了人类可读的规范,并且在专业领域已显示出优于直接偏好优化(DPO)的性能。第二种方法是基于人类反馈的马尔可夫链(MCHF),它直接使用成对偏好来定义模型输出的转换机制,并快速收敛到平稳分布。…
-
新的 NLHF 算法通过显式探索改进了 LLM 的对齐
研究人员开发了一种新的纳什人类反馈学习 (NLHF) 算法,该算法解决了当前使大型语言模型与人类偏好对齐的方法的局限性。所提出的算法明确地纳入了探索以改进遗憾界限,实现了理论上的 $O(\sqrt{T})$ 遗憾,并在有预言机的情况下实现了改进的 $O(\log(T))$。该方法在 Llama-3-8B-Instruct 上进行了测试,与现有的 NLHF 基线相比,表现有所提升。