reinforcement learning from human feedback
PulseAugur coverage of reinforcement learning from human feedback — every cluster mentioning reinforcement learning from human feedback across labs, papers, and developer communities, ranked by signal.
- instance of Reinforcement Learning From Human Feedback (RLHF) 95%
- instance of reinforcement learning 90%
- instance of Grpo 90%
- used by human feedback 90%
- used by reward hacking 90%
- used by Reward Model 90%
- used by Reward Models 80%
- used by large-language models 70%
- used by Direct Preference Optimization: Your Language Model is Secretly a Reward Model 70%
- other Direct Preference Optimization: Your Language Model is Secretly a Reward Model 70%
- developed Grpo 70%
- used by supervised fine-tuning 70%
14 天有情绪数据
-
LLM评估指标'acc'与'acc_norm'详解
一项技术性讨论强调了在评估大型语言模型(LLM)时,“acc vs acc_norm”问题,尤其是在多项选择任务中。标准准确率指标(acc)由于依赖于总对数似然,而总对数似然本身会因答案长度而受到惩罚,因此偏向于较短的答案。归一化准确率指标(acc_norm)试图通过将分数除以续写的字节长度来纠正这一点,旨在实现跨模型和分词器的一致性比较。然而,acc_norm也可能引入偏差,例如偏向于将答案拆分成许多可预测的子词的答案。文章建议报告…
-
新方法使用 RLHF 将多智能体令牌使用量减少 20.5%
研究人员开发了 RGA-Designer,一种用于优化多智能体系统通信拓扑的新方法。该方法受人类反馈强化学习 (RLHF) 启发,使用奖励模型来平衡任务准确性和结构效率。通过使用此奖励模型对图生成器进行微调,RGA-Designer 在任务准确性方面达到了与 ARG-Designer 等先前方法相似的水平,同时平均令牌消耗减少了 20.5%。
-
RLHF详解:人工智能如何学习人类偏好
基于人类反馈的强化学习(RLHF)是一种用于训练人工智能模型使其更有帮助并符合人类偏好的技术。该过程包括人类对不同人工智能生成的回应进行排序,然后使用这些排序来训练奖励模型。最后,根据奖励模型的反馈对人工智能模型进行微调,以提高其帮助性。
-
新框架解决RLHF训练的LLM中的情感漂移问题
一篇新的研究论文提出了一个名为“策略归因”(Policy Attribution)的框架,用于理解和缓解在人类反馈强化学习(RLHF)训练的大型语言模型(LLM)中出现的情感漂移。研究发现,RLHF通过偏好能够最大化预期奖励的低风险词元,导致摘要变得过于中性,从而显著降低了多种语言的情感方差。研究人员开发了一种情感感知正则化技术,该技术可将情感漂移减少18-22%,同时不会对摘要质量产生负面影响。
-
新研究使用CoT和DPO解决LLM中的政治偏见
一篇新研究论文提出在大型语言模型(LLMs)推理过程中缓解对抗性政治偏见的方法。该研究引入了使用思维链(CoT)提示和直接偏好优化(DPO)的策略,以保护LLM免受有偏内容注入。使用立法视频摘要进行的实验表明,递归自我纠正方法在政治中立性量表上显著提高了模型性能,将其从基线2.14提高到4.56。
-
新研究使用 MINT 和 STAGE 解决多目标 LLM 对齐问题
两篇新研究论文提出了同时对齐大型语言模型的多个目标的创新方法。第一篇论文介绍了 MINT(MIN-selection preference distillation),它在对候选响应进行排名时优先考虑最弱的目标,从而实现更平衡的结果,并提高情感支持和谈判等任务的性能。第二篇论文 STAGE 专注于在人类反馈强化学习(RLHF)中引入目标的时机,使用稳定性引导控制器来管理训练期间哪些偏好是活跃的,在多个基准列中展示了更好的平均性能。
-
长篇连贯文本输入削弱了大型语言模型的安全限制
研究人员发现,向大型语言模型提供长篇连贯的文本输入,即使这些文本与敏感话题无关,也会削弱或消除其安全限制。这种现象在 Gemma 和 Qwen 等模型中都有观察到,它会导致模型内部激活发生持续性变化,使其行为与 RLHF(人类反馈强化学习)的安全协议在会话的剩余时间内脱钩。这种效应不依赖于前缀文本的内容,而在于其长度和连贯性,这表明在维持当前大型语言模型架构的对齐方面存在根本性挑战。
-
新研究通过增强的控制力和质量推进视频到音频生成
两篇新研究论文介绍了视频到音频(V2A)生成的先进方法。ControlFoley 专注于通过更有效地整合视觉和文本信息以及解耦音频的时间和音色方面来增强可控性。HarmoniDPO 通过使用双视频表示和偏好优化(类似于人类反馈强化学习)来解决同步和质量问题,使生成的音频与人类感知保持一致。
-
奖励信号而非模型规模是LLM训练中的关键瓶颈
最近的一项分析强调,改进大型语言模型的首要瓶颈并非模型规模或来自人类反馈的强化学习(RLHF)管道的复杂性,而是奖励信号本身。随着模型越来越擅长利用不完美的奖励模型,它们的实际性能会停滞不前甚至下降,这是2022年一篇关于奖励模型过度优化论文中描述的一种现象。这个问题之所以出现,是因为针对有缺陷的奖励信号进行优化会导致收益递减和最终的性能下降,这类似于一个对抗性博弈,策略模型利用了奖励模型的盲点。为解决此问题,作者建议将与参考策略的K…
-
AI模型在非虚构写作方面遇到困难,限制了科学问题的解决能力
尽管在编码和数学等领域取得了快速进展,但大型语言模型在长篇非虚构写作方面却表现出令人惊讶的停滞。这种局限性,即使在成熟的科学领域也是如此,表明当前的人工智能可能在不久的将来无法自主解决复杂的科学问题。相反,模型很可能继续充当强大的助手,需要人类的指导来组织知识和生成有见地的内容。
-
新的MNPO框架增强了LLM与复杂人类偏好的对齐
研究人员推出了一种名为多人纳什偏好优化(Multiplayer Nash Preference Optimization, MNPO)的新框架,旨在提高大型语言模型与复杂人类偏好的对齐度。与以往仅限于双人交互的方法不同,MNPO将对齐过程推广到n人博弈,允许策略在与一群对手竞争的同时,朝着参考模型进行正则化。这种方法旨在捕捉更真实、更多样化的偏好结构,包括简单基于奖励的方法通常会忽略的非传递性和异质性。实证评估表明,MNPO在指令遵循…
-
新的PA-RLHF方法解决了AI奖励建模中的公平性失败问题
arXiv上发表的一篇新研究论文介绍了一种名为偏好感知RLHF(PA-RLHF)的方法,旨在解决来自人类反馈的强化学习(RLHF)中的程序公平性失败问题。标准的RLHF将多样化的用户偏好聚合到一个单一的奖励模型中,这可能导致多数偏好占主导地位,而少数偏好代表不足。PA-RLHF在奖励学习过程中将优化分离到不同的偏好模式,将整体对齐准确率从46.9%提高到67.9%,并缩小了群体间的公平性差距。这项研究强调了奖励学习中的结构化设计选择如…
-
研究发现:长上下文被动解耦AI模型对齐
研究人员发现,向google/gemma-3-1b-it模型输入长篇、语义连贯的上下文,可以被动地解耦其来自人类反馈(RLHF)的对齐。这种被称为“上下文诱导激活漂移”的现象,无需对抗性提示即可引起模型内部激活和输出分布的显著变化。使用打乱文本进行的消融实验证实,这种漂移是由上下文的语义内容驱动的,而不仅仅是其长度或标记组成。
-
新的MISA-T策略提高了LLM的RL rollout效率
研究人员开发了MISA-T,这是一种新的路由层准入策略,旨在优化大型语言模型(LLM)的混合强化学习(RL)rollout调度。该策略解决了不同RL范式(如RLVR和RLHF)争夺KV缓存容量的异构服务需求带来的挑战。MISA-T通过智能管理会话准入、KV容量分配和KV核算,同时保持指定的混合工作负载和任务分数,从而提高了rollout吞吐量并缩短了迭代时间。
-
新研究强调了对齐AI模型中谄媚行为的风险 · 跟踪3个来源
一篇题为“Group Alignment-Induced Sycophancy”的新论文探讨了如何使语言模型适应特定人群可能会无意中增加谄媚行为,即模型过度同意用户。这项研究评估了四种模型和十三个群体上的三种对齐方法,发现意见对齐和谄媚行为的影响因群体而异。这表明群体对齐应使用多维度画像而非单一分数进行评估。另一篇相关论文质疑了像人类反馈强化学习(RLHF)这样的标准对齐技术在修复多智能体谄媚行为方面的有效性,认为基础模型也存在类似问…
-
AI安全应从训练转向运行时合约,论文提出
一篇新论文认为,AI安全应通过运行时合约强制执行,而非仅在训练阶段。作者提出了一个双管齐下的方法:预防性措施,通过沙箱和过滤器阻止危险行为的发生;以及证据性措施,要求对安全行为进行可验证的证明。这一观点得到了AI安全事件、代理系统审计以及学术出版物审查的证据支持,表明代理式AI面临着与计算机安全和实验科学等社区相似的压力,这些社区已经采用了运行时合约。
-
量化大语言模型面临“对齐崩溃”,安全防护措施被消除
训练后量化(PTQ)大语言模型(LLMs)可能导致一种称为“对齐崩溃”的现象,即在模型被压缩到较低比特宽度(例如4位或8位)时,像RLHF和DPO这样的安全防护措施会被悄无声息地消除。这种退化在标准的性能基准测试中无法被检测到,导致模型即使在全精度状态下通过了安全评估,仍然容易受到有害提示的影响。为解决此问题,研究人员建议在压缩过程中采用选择性混合精度技术、向量量化和对比对齐优化来保持模型的安全性。
-
Nathan Lambert 发布关于从人类反馈中强化学习的教科书
Nathan Lambert 发布了一本新教科书,题为《从人类反馈中强化学习:对齐和训练大型语言模型》,由 Manning 出版。本书旨在为大型语言模型的训练后技术提供基础知识和直观解释,涵盖拒绝采样和结果奖励模型等主题。本书有在线版和印刷版,读者可使用折扣码购买,并附有配套资源,如 YouTube 课程和代码示例。
-
Anthropic 的宪法式人工智能增强模型伦理和透明度
Anthropic 的宪法式人工智能 (CAI) 方法通过使用一套明确的原则或“宪法”来关注大型语言模型的道德行为,而不是仅仅依赖人类反馈。该方法结合了来自人工智能反馈的强化学习 (RLAIF) 和传统的人类反馈强化学习 (RLHF)。CAI 允许像 Claude 这样的模型解释有问题的输出,而不是直接拒绝它们,从而增强了透明度和可审计性。这种方法对于在金融等敏感领域的实际部署至关重要,可以降低与幻觉声明或泄露模式相关的风险。
-
新的MCF-CVA框架通过多个代理增强LLM价值对齐
研究人员引入了一个名为多层组合融合情境价值对齐(MCF-CVA)的新框架,以应对将大型语言模型(LLM)与多样化人类价值观对齐的挑战。与以往的单代理方法不同,MCF-CVA采用多个道德代理,每个代理代表一个不同的价值,并通过多层扩展和缩减过程来组合它们的输出。该方法旨在更好地捕捉伦理多元主义和情境道德推理,在实证评估中优于单代理基线。