UltraFeedback
PulseAugur coverage of UltraFeedback — every cluster mentioning UltraFeedback across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新算法旨在用更少的模型实现大语言模型的个性化对齐
研究人员开发了PALM(Portfolio of Aligned LLMs,已对齐大语言模型组合)算法,旨在创建一个精简的大语言模型(LLM)集,能够有效平衡用户偏好中诸如有用性和无害性等相互竞争的目标。该方法使用结构化的权重向量网格和惰性搜索来识别一个小型组合,该组合能近似所有奖励权重下的最优性能,从而实现可扩展的个性化和高效的模型开发。另外一项研究引入了近似帕累托最优(APO)方法,通过对具有兼容更新的用户进行分组并协调相互竞争的…
-
新方法通过执行验证提升大语言模型数学推理能力
研究人员开发了一种新方法,通过结合基于执行的验证和依赖感知过滤来提高大语言模型的数学推理能力。该方法生成具有依赖图的计算上可靠的解决方案,增强了科学任务的偏好优化。当应用于 Llama-3-8B 和 DeepSeekMath-7B 时,该方法在 MATH 和 GSM8K 基准测试上取得了显著的改进。此外,扩展此框架在 PhyX 多模态物理推理任务上取得了最先进的成果,展示了高度的科学有效性并减少了科学定律的违规行为。
-
研究发现:大型语言模型推理表现出超越价值对齐的非理性
arXiv上的一篇新研究论文探讨了大型语言模型中“理性价值风险”的概念,指出即使是经过良好对齐的模型在推理过程中也可能表现出非理性。这种风险被量化为模型已部署的推理策略与其理性最大化对齐效用的策略之间的差异。该研究在多个基准测试中测试了包括Llama-3.1、Qwen-2.5、Tülu-3、GPT-5.2、GPT-5.5和DeepSeek-V4在内的模型,发现这种风险普遍存在。虽然价值对齐可以减少但不能消除这种非理性,但诸如自洽性(s…
-
新方法通过建模奖励不确定性来增强LLM对齐
研究人员开发了一种名为不确定性感知奖励建模(UARM)的新方法,以提高大型语言模型中来自人类反馈的强化学习(RLHF)的稳定性。传统的RLHF方法存在困难,因为它们的奖励模型提供确定性预测,未能表明何时其估计是不可靠的。这可能导致策略放大错误的奖励信号,造成“奖励破解”。UARM通过分位数共轭预测和基于方差分解的策略优化优势重加权来整合校准的不确定性,从而解决这个问题。在HelpSteer和UltraFeedback等基准数据集上的实…
-
新指标衡量多轮人工智能对话中的语义进展
研究人员开发了一种新指标来评估多轮对话中的语义进展,重点关注新颖、相关且非冗余信息的累积。这种信息论方法通过测量问题条件下的不确定性降低来量化进展,为 LLM-作为-裁判方法提供了一种可复现且高效的替代方案。实验表明,即使使用轻量级嵌入模型,该指标在 MT-Bench 和 UltraFeedback 等基准测试上与人类判断也高度一致。
-
新的 Pair-GRPO 算法增强了 LLM 对齐的稳定性和泛化能力
研究人员引入了 Pair-GRPO 系列,这是一个新颖的理论框架,旨在增强用于对齐大型语言模型(LLM)的强化学习(RL)的稳定性和通用性。该系列包含两个变体:Soft-Pair-GRPO 和 Hard-Pair-GRPO,它们通过优化奖励信号和引入显式策略约束,解决了当前成对偏好学习方法的局限性。在标准的 LLM 对齐基准和连续控制任务上的实验表明,Pair-GRPO 在对齐质量和训练稳定性方面始终优于现有方法。