AlpacaEval
PulseAugur coverage of AlpacaEval — every cluster mentioning AlpacaEval across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的UNM-DPO方法增强了语言模型的偏好学习
研究人员引入了一种名为不确定性归一化的直接偏好优化(UNM-DPO)的新方法,以改进语言模型从人类偏好中学习的方式。与标准的DPO不同,UNM-DPO通过纳入学习到的提示尺度来考虑人类反馈中偏好的强度和不确定性。新方法包括两个训练目标:仅优势(AO)和整体残差(WR),其中ULNM-DPO-WR通过响应长度进一步归一化奖励。在HelpSteer2和AlpacaEval等基准上的评估表明,与现有的DPO和SimPO基线相比,UNM-DP…
-
新的 AI 对齐方法提高了效率和多维控制 · 跟踪 3 个来源
研究人员正在开发新的方法来使 AI 模型与人类偏好对齐,旨在提高效率和性能。一种方法 DSPA 使用推理时引导,根据提示进行对齐,在计算量更少的情况下有望改进 MT-Bench 和 AlpacaEval 等基准测试。另一种方法 DP3O 通过首先学习显式偏好模型,然后蒸馏其知识来解决离线和迭代对齐之间的差距,其性能优于最先进的离线方法并减少了训练时间。此外,MCDPO 通过对奖励本身进行条件化来解决标准 DPO 在扩散模型上的局限性,…
-
研究发现,LLM评估锚点必须避免极端值,以获得可靠排名
arXiv上的一篇新研究论文探讨了锚点选择在大型语言模型(LLM)评估中的关键作用。该研究在Arena-Hard-v2.0数据集上测试了22个不同的锚点,发现使用极端模型(表现最好或最差)作为锚点会显著降低与人类排名的相关性。研究人员认为,锚点选择的影响与裁判模型本身的选择相当。他们为选择更具信息量的锚点提供了建议,并指出当前的基准测试规模不足以可靠地评估具有竞争力的模型。
-
研究发现:大型语言模型推理表现出超越价值对齐的非理性
arXiv上的一篇新研究论文探讨了大型语言模型中“理性价值风险”的概念,指出即使是经过良好对齐的模型在推理过程中也可能表现出非理性。这种风险被量化为模型已部署的推理策略与其理性最大化对齐效用的策略之间的差异。该研究在多个基准测试中测试了包括Llama-3.1、Qwen-2.5、Tülu-3、GPT-5.2、GPT-5.5和DeepSeek-V4在内的模型,发现这种风险普遍存在。虽然价值对齐可以减少但不能消除这种非理性,但诸如自洽性(s…
-
新的DARTS技术通过熵加权损失改进了解码器LLM合并
研究人员开发了一种名为DARTS(Decoder-Aware Representation Tuning via Surgery,解码器感知表示调整手术)的新技术,以改进基于解码器的LLM的模型合并。与以前用于编码器模型的方法不同,DARTS解决了解码器架构的独特挑战,例如跨token位置的偏差累积以及不同token位置的不同重要性。该方法使用熵加权损失函数来优先处理关键决策位置的校正,并结合了每位置的加性偏差来捕获位置相关的错误。
-
研究发现:LLM自生成文本识别对AI安全构成风险
一篇新的研究论文探讨了大语言模型中自生成文本识别(SGTR)的现象,即LLM识别自身输出的能力。研究强调,SGTR对依赖LLM进行评估的AI安全机制构成风险,因为模型可能会表现出有偏见的判断,或者通过识别相似模型的输出来进行串通。该研究通过证明SGTR的准确性高度依赖于实验设计(包括评估格式、对话结构和生成文本的领域)来调和先前相互冲突的发现。论文还指出,通过监督微调改进SGTR可以泛化到不同的配置,并可能导致模型在AlpacaEva…
-
AI开发流程中模型生成组件的比例日益增加
AI开发流程正日益从人类创建的组件转向模型生成的组件。自2022年以来,奖励信号、训练数据生成和教师模型等阶段已变得合成化。最新的进展是课程阶段,模型可以决定自己的学习路径和任务,有效地成为自己的研究者。这一趋势表明,未来AI系统将很大程度上实现自我改进,人类在核心开发过程中的作用将变得不那么关键。
-
研究发现,用于AI评估的LLM裁判存在缺陷
使用LLM作为评估其他LLM的自动化裁判存在重大问题,因为它们的准确性检查可能无法反映真实性能。这个问题之所以出现,是因为自动化审阅者本身的质量尚未得到充分评估。因此,像GPT-4、Claude 3和Gemini这样的模型在这些有缺陷的评估中可能表现良好,从而掩盖了潜在的不足。
-
新框架和方法解决LLM裁判的偏见 · 跟踪4个来源
研究人员正在开发新方法来解决大型语言模型(LLM)在用作文本质量评估裁判时的评分偏差问题。一种方法是指示LLM生成随机数,以识别和纠正潜在的数值偏差,与现有方法相比表现有所提高。另一项研究引入了JudgeArena,这是一个统一的框架,可以跨不同基准和模型标准化LLM裁判的评估,从而提高可重复性和透明度。此外,一个名为JudgeBiasBench的新基准系统地量化了LLM裁判中不同类型的偏差,而一种称为Chain-of-Models的…
-
新研究强调AI“宪法”的模糊性以及跨模型原则差异
一篇新发表在arXiv上的研究论文探讨了语言模型“宪法”的重建挑战和开放性问题。“宪法”是指从偏好数据中提取的一组自然语言原则。研究强调,仅仅列出原则是不够的,因为这些原则的构成和执行仍然存在模糊性。研究发现,执行这些原则的不同方法可能导致不同的结果,并且不同语言模型的“宪法”可能存在显著差异。该论文提出,应将“宪法”作为“宪法执行系统”的一部分进行评估,以提高可解释性和一致性。
-
LLM 裁判成为评估 AI 编码性能的关键工具
“LLM 裁判”的概念正作为一种评估大型语言模型性能的方法出现,尤其是在编码任务方面。这些裁判通常由 GPT-4 或 Claude 3 等先进模型提供支持,根据特定标准评估其他模型的输出。AlpacaEval 和 Mt Bench 等基准测试采用了这种方法来比较 Vicuña、Llama 2 和 mistral.ai 等模型,旨在提供对模型能力更细致的理解,超越简单的准确性指标。
-
新的DoubtProbe防御显著减少了LLM越狱
研究人员开发了DoubtProbe,这是一种新颖的防御机制,旨在应对黑盒场景下大型语言模型(LLM)的越狱尝试。该双分支框架结合了结构验证和语义审计,以识别逃避安全对齐的越狱提示中的不一致之处。在Qwen2.5-72B和Llama 3.1 70B等模型上进行测试时,DoubtProbe显著降低了攻击成功率,同时在良性请求上保持了较低的误报率。
-
EvoDefense 使用大型语言模型协同进化黑盒攻击的防御机制
研究人员开发了 EvoDefense,这是一种在黑盒场景下保护大型语言模型(LLM)免受攻击的新颖方法。该系统使用一个守护 LLM 和一个经验记忆,通过迭代的攻击-防御进化循环不断完善防御策略。EvoDefense 展现出强大的泛化能力,无需重新训练即可有效防御未见的攻击和各种 LLM 架构。
-
IBM 新推出的 8B Granite 4.1 模型性能超越了旧款 32B MoE 版本
IBM 发布了 Granite 4.1,这是一个专为企业设计的开源语言模型家族,包含三种尺寸(3B、8B 和 30B 参数)。值得注意的是,在 ArenaHard 和 GSM8K 等多项基准测试中,8B 密集模型表现出的性能与之前的 32B MoE 模型相当甚至更优。这一改进归功于 IBM 对数据质量的关注以及涉及 15 万亿 token 和迭代数据混合调整的复杂多阶段训练过程。
-
研究人员开发新方法来消除大型语言模型(LLM)奖励模型的偏差并改进其性能
研究人员开发了新的方法来提高用于对齐大型语言模型(LLM)的奖励模型(RM)的可靠性和可解释性。一种方法引入了因果驱动的干预技术,以在推理时减轻 RM 中的各种偏差,显示出对虚假特征的敏感性降低,而没有性能权衡。另一项开发是“reward-lens”库,它将机制可解释性工具应用于 RM,揭示线性归因并不总是能预测因果打补丁的效果。此外,一种称为时间连贯奖励建模(TCRM)的新方法将 RM 视为价值函数,从而能够进行可解释的 token…
-
新的DPO方法通过自适应技术增强LLM对齐
研究人员在直接偏好优化(DPO)方面取得了几项进展,DPO是一种用于将大型语言模型(LLM)与人类偏好对齐的方法。AdaDPO引入了自适应系数来平衡梯度更新,提高了效率并减轻了长度偏差,在基准测试中表现优于标准DPO。Uni-DPO提供了一个统一的动态框架,根据数据质量和模型性能自适应地重新加权样本,在各种任务上取得了优于Claude 3 Opus的卓越结果。此外,AttentionPO利用LLM自身的注意力机制来加权token,使其…