Arena-Hard
PulseAugur coverage of Arena-Hard — every cluster mentioning Arena-Hard across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Alice 和 GigaChat AI 模型在五个基准测试上的比较
对俄罗斯 AI 模型 Alice (Yandex) 和 GigaChat (Sber) 在五个基准测试上进行了比较:τ³, PRAKT-120, MultiChallenge, WildBench 和 Arena-Hard。测试过程非常广泛,由于设置、等待时间和模型不稳定,大约持续了两周。作者指出,虽然 Marusya AI 最初计划包含在内,但它目前正在重构为一个主权编码环境。因此,展示的结果集中在 Alice、GigaChat U…
-
新框架AlignDiff提升LLM对齐数据质量
研究人员开发了AlignDiff,一个旨在提高用于对齐大型语言模型(LLM)的偏好数据质量的新框架。该框架通过利用内在模型信号以及正向和反向信号之间的差距来识别和优先处理具有挑战性的样本。在LLaMA和Qwen模型上,跨AlpacaEval 2.0、Arena-Hard和MT-Bench等基准的评估表明,AlignDiff的表现持续优于现有基线,并且通过基于难度的课程学习进一步提高了性能。
-
研究发现,LLM评估锚点必须避免极端值,以获得可靠排名
arXiv上的一篇新研究论文探讨了锚点选择在大型语言模型(LLM)评估中的关键作用。该研究在Arena-Hard-v2.0数据集上测试了22个不同的锚点,发现使用极端模型(表现最好或最差)作为锚点会显著降低与人类排名的相关性。研究人员认为,锚点选择的影响与裁判模型本身的选择相当。他们为选择更具信息量的锚点提供了建议,并指出当前的基准测试规模不足以可靠地评估具有竞争力的模型。
-
Se-DPO 通过自演化代币信用增强语言模型训练
研究人员推出了一种新颖的直接偏好优化(DPO)方法 Se-DPO,该方法可动态调整单个代币对偏好信号的贡献。与传统上同等对待所有代币的 DPO 不同,Se-DPO 根据每个代币的隐式奖励幅度和置信度分配“代币信用”。这种自演化信用机制通过一个轻量级的校准网络实现,旨在提高训练过程中的对齐度。实验表明性能显著提升,在 Arena-Hard 等基准测试中,Se-DPO 的表现比标准 DPO 高出 12.2 个百分点。
-
新框架和方法解决LLM裁判的偏见 · 跟踪4个来源
研究人员正在开发新方法来解决大型语言模型(LLM)在用作文本质量评估裁判时的评分偏差问题。一种方法是指示LLM生成随机数,以识别和纠正潜在的数值偏差,与现有方法相比表现有所提高。另一项研究引入了JudgeArena,这是一个统一的框架,可以跨不同基准和模型标准化LLM裁判的评估,从而提高可重复性和透明度。此外,一个名为JudgeBiasBench的新基准系统地量化了LLM裁判中不同类型的偏差,而一种称为Chain-of-Models的…
-
新框架解决AI反馈中的偏好循环问题
研究人员开发了一个名为拓扑共识奖励(TCR)的新框架,以提高来自AI反馈的强化学习(RLAIF)的稳定性。该方法解决了偏好循环问题,这是大型语言模型(LLM)裁判中的随机测量误差,可能导致排名不一致。TCR利用拓扑多数投票来区分系统趋势和随机噪声,从而对偏好信号进行去噪,在各种基准测试中优于现有的成对和排名算法。