PulseAugur
实时 15:44:05
实体 Reward Models

Reward Models

PulseAugur coverage of Reward Models — every cluster mentioning Reward Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 12
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 12
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 12 条
  1. RESEARCH · CL_216063 ·

    LLM评判者在评估任务中表现出偏见和漏洞 · 跟踪4个来源

    近期研究强调了大型语言模型(LLM)评判者中存在的显著偏见和漏洞,这些评判者越来越多地被用于评估AI输出。研究表明,这些评判者容易受到模型提取攻击,其评判能力可以在不同评估协议下被高精度地复制。此外,LLM评判者表现出锚定效应偏见,即先前的分数会系统性地影响后续的判断,从而损害评估的独立性。即使在被提示考虑变化或忽略元数据的情况下,这些偏见依然存在,影响了代码评估和其他任务的可靠性。

  2. TOOL · CL_212075 ·

    新方法优化 LLM 评估小组以提高效率和准确性

    一篇新的研究论文提出了一种优化大型语言模型(LLM)评估小组选择和部署的方法。该方法将评判小组设计为一个条件化角色分配问题,根据审计集和成本估算不同评判员的目标相对角色。这形成了一个策略,规定何时删除冗余评判员、添加互补评判员、有条件地路由专家,以及在验证收益减少时停止流程。该方法在推理、代码、安全和数学等多个领域进行了测试,证明了其在创建 LLM 评估的可重用和可审计调用计划方面的有效性。

  3. TOOL · CL_174116 ·

    新基准揭示了大型语言模型个性化的局限性

    研究人员推出了 Personalized RewardBench,这是一个旨在评估大型语言模型奖励模型在多大程度上能够捕捉个体用户偏好的新基准。现有的最先进奖励模型在个性化方面显示出显著的局限性,在预测用户偏好方面的准确率仅为 75.94%。与现有方法相比,新基准在诸如 Best-of-N 采样和 Proximal Policy Optimization 等任务中的下游性能显示出更高的相关性,从而证明了其在实际应用中评估奖励模型的效用。

  4. RESEARCH · CL_167574 ·

    研究发现:AI奖励模型会记住数据集捷径并过度泛化

    一篇新论文研究了判别式训练的奖励模型(RMs)的记忆模式。研究表明,奖励模型倾向于将记忆分配给更简单的偏好对,学习模型身份等特定于数据集的捷径,并过度泛化响应长度等简单启发式方法。这些发现表明,目前在人类偏好数据上训练的奖励模型可能会产生有偏见的判断,并且尚未能熟练地在依赖上下文的情况下评估响应质量。

  5. RESEARCH · CL_111634 ·

    新的自引导方法提高了AI图像生成的​​多样性

    研究人员开发了一种新的无需训练的方法,称为特征自引导,以解决用于图像生成的预训练流模型中的多样性崩溃问题。该技术在批量生成过程中分散内部特征,并使用流形正则化使其与数据流形保持一致,从而在不牺牲质量的情况下确保输出的多样性。这种即插即用模块的推理成本很小,并且在文本到图像和深度到图像生成等各种条件流模型的​​多样性方面显示出显著的改进。

  6. TOOL · CL_111518 ·

    Hugging Face论文解决强化学习中奖励模型的过度敏感问题

    Hugging Face的一篇新论文介绍了一种方法来解决强化学习中使用的奖励模型的过度敏感问题。这些模型在对齐语言模型方面至关重要,但可能给相同的响应分配不同的分数,从而阻碍有效的策略学习。该研究提出根据“区分能力”和“特异性”(过度敏感的倒数)来评估奖励模型,并提供了一种使用蒙特卡洛 dropout 的无训练算法来离散化奖励,从而改进策略学习并减少奖励攻击。

  7. RESEARCH · CL_86663 ·

    AI奖励模型显示出有用性与无害性之间的张力

    一篇新的研究论文探讨了AI奖励模型中“有用性”与“无害性”之间的张力,这是从人类反馈中强化学习(RLHF)的一个关键组成部分。研究发现,在混合目标上训练的模型通常表现不如在单一目标上训练的模型,这表明目标之间存在干扰。通过识别和消融特定的神经元,研究人员观察到这些神经元在因果上支持一个目标,同时对另一个目标产生负面影响,共享神经元在这种对齐张力中起着重要作用。这些发现为理解多目标对齐为何具有挑战性提供了机制性见解,并为开发更分离和可控…

  8. RESEARCH · CL_79582 ·

    新的DynaCF框架解决了AI奖励模型中的捷径学习问题

    研究人员推出了一种新颖的DynaCF框架,旨在解决AI训练中使用的奖励模型中的捷径学习问题。该方法通过评估训练样本对反事实扰动的敏感性来动态地重新加权样本,从而降低那些依赖于表面模式的样本的权重。通过鼓励奖励模型关注真实的响应质量而非虚假关联,DynaCF旨在提高AI系统中偏好建模的鲁棒性和可靠性。

  9. RESEARCH · CL_76835 ·

    新研究强调大语言模型个性化在人类数据方面存在差距

    一篇新论文通过比较合成数据评估与真实人类对话,探讨了大语言模型(LLM)个性化的有效性。研究发现,大语言模型难以准确地从人类互动中提取用户属性,并且生成的个性化回复常常不被人类认为优于通用回复。研究人员引入了干预措施来改进个性化评估的早期阶段,但指出学习到的奖励模型与人类判断的相关性仍然适中,这表明在模拟与人类一致的个性化方面存在挑战。

  10. TOOL · CL_99536 ·

    Hugging Face 论文发现 LLM 在以人为中心的个性化方面表现不佳

    Hugging Face 的一篇新论文强调了大型语言模型 (LLM) 在使用合成数据与真实人类互动进行个性化方面的显著差距。研究发现,LLM 在准确提取用户属性、将相关属性匹配到新提示以及生成人类认为真正有帮助的个性化响应方面存在困难。人类评估显示,LLM 经常过度个性化,并且自动奖励模型与人类质量判断仅有适度相关性,这凸显了在 LLM 个性化中重新关注人类数据的必要性。

  11. RESEARCH · CL_65748 ·

    新方法应对 AI 训练中的奖励欺骗问题

    研究人员正在开发新方法来对抗人类反馈强化学习 (RLHF) 系统中的奖励欺骗问题。几篇论文介绍了检测和缓解模型利用奖励模型偏差导致次优或不安全结果的场景的技术。这些方法包括监控评估分数的调度原语、用于分析欺骗行为的可控环境,以及旨在提高鲁棒性和可解释性的新型奖励建模框架。

  12. RESEARCH · CL_15878 ·

    新研究探索用于大型语言模型和扩散模型的先进奖励建模

    几篇新研究论文探讨了用于人工智能对齐的奖励建模的进展,特别是针对大型语言模型和扩散模型。其中一篇论文介绍了SelectiveRM,一个使用最优传输来处理奖励建模中嘈杂的人类偏好的框架。另一篇论文CAMEL提出了一种置信门控反射方法,选择性地对低置信度实例调用反射,以更少的参数实现了最先进的准确性。此外,还开发了一个名为RMGAP的新基准来评估奖励模型在不同用户偏好上的泛化能力,揭示了当前模型的重大局限性。最后,ArenaPO利用Are…