PKU-SafeRLHF
PulseAugur coverage of PKU-SafeRLHF — every cluster mentioning PKU-SafeRLHF across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新型防御LIV可对抗LLM的语义伪装
一篇新研究论文介绍了一种名为潜在意图验证(LIV)的防御机制,旨在对抗针对大型语言模型(LLM)的语义伪装攻击。这些攻击将有害意图嵌入到良性上下文中,从而绕过标准的安保措施。研究表明,即使在后续层看起来与安全查询无法区分的情况下,小型语言模型(SLM)的早期层仍然保留着可检测的“危害特征”。LIV利用这一点,通过探测这些早期层,在不要求模型重新训练的情况下,将中和零日语义攻击的能力比传统安保措施提高了20-50%。
-
通过偏差-方差视角分析AI对齐风险 · arXiv论文
一篇新发表在arXiv上的论文分析了AI系统中弱到强对齐相关的风险。该研究提出了一个偏差-方差-协方差框架,以理解强模型如何在弱模型知识范围之外的示例上产生自信的错误。研究评估了包括监督微调和强化学习方法在内的四种对齐流程,使用了PKU-SafeRLHF和HH-RLHF等数据集。研究结果表明,强模型的方差是导致“盲点欺骗”(模型自信地出错)的主要因素,表明方差可能是此类故障的潜在早期预警信号。
-
研究发现:AI对齐方法难以消除有害的LLM输出
一篇新的研究论文探讨了当前AI对齐技术(特别是支持保持对齐和有界过滤)在完全消除大型语言模型有害输出方面的局限性。该研究将此问题形式化,并提供了理论和经验证据,表明即使增加了过滤计算量,有害输出的持续底层仍然存在。这表明当前实用的对齐流程可能不足以保证完全消除有害行为。
-
新方法通过建模奖励不确定性来增强LLM对齐
研究人员开发了一种名为不确定性感知奖励建模(UARM)的新方法,以提高大型语言模型中来自人类反馈的强化学习(RLHF)的稳定性。传统的RLHF方法存在困难,因为它们的奖励模型提供确定性预测,未能表明何时其估计是不可靠的。这可能导致策略放大错误的奖励信号,造成“奖励破解”。UARM通过分位数共轭预测和基于方差分解的策略优化优势重加权来整合校准的不确定性,从而解决这个问题。在HelpSteer和UltraFeedback等基准数据集上的实…
-
新的CompassDPO框架增强了AI安全对齐的鲁棒性
研究人员推出了一种名为CompassDPO的新框架,旨在增强语言模型安全对齐的鲁棒性。该方法通过控制优化动力学,解决了直接偏好优化(DPO)对不完美监督的敏感性问题。CompassDPO使用隐式奖励边际作为指导,来调节样本对更新方向和幅度的影响,而无需外部奖励模型或额外数据。