Arena-Hard
PulseAugur coverage of Arena-Hard — every cluster mentioning Arena-Hard across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Se-DPO 通过自演化代币信用增强语言模型训练
研究人员推出了一种新颖的直接偏好优化(DPO)方法 Se-DPO,该方法可动态调整单个代币对偏好信号的贡献。与传统上同等对待所有代币的 DPO 不同,Se-DPO 根据每个代币的隐式奖励幅度和置信度分配“代币信用”。这种自演化信用机制通过一个轻量级的校准网络实现,旨在提高训练过程中的对齐度。实验表明性能显著提升,在 Arena-Hard 等基准测试中,Se-DPO 的表现比标准 DPO 高出 12.2 个百分点。
-
新框架和方法解决LLM裁判的偏见 · 跟踪4个来源
研究人员正在开发新方法来解决大型语言模型(LLM)在用作文本质量评估裁判时的评分偏差问题。一种方法是指示LLM生成随机数,以识别和纠正潜在的数值偏差,与现有方法相比表现有所提高。另一项研究引入了JudgeArena,这是一个统一的框架,可以跨不同基准和模型标准化LLM裁判的评估,从而提高可重复性和透明度。此外,一个名为JudgeBiasBench的新基准系统地量化了LLM裁判中不同类型的偏差,而一种称为Chain-of-Models的…
-
新框架解决AI反馈中的偏好循环问题
研究人员开发了一个名为拓扑共识奖励(TCR)的新框架,以提高来自AI反馈的强化学习(RLAIF)的稳定性。该方法解决了偏好循环问题,这是大型语言模型(LLM)裁判中的随机测量误差,可能导致排名不一致。TCR利用拓扑多数投票来区分系统趋势和随机噪声,从而对偏好信号进行去噪,在各种基准测试中优于现有的成对和排名算法。