PulseAugur
中
实时 09:38:25
实体 RM-Bench

RM-Bench

PulseAugur coverage of RM-Bench — every cluster mentioning RM-Bench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
4
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
4
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_284368 ·

    开放式对比决策模型在公开LLM评委基准上表现不佳

    一篇新的研究论文介绍了一个名为Contrastive-LM/CLM-v0.1-8B的开放式对比决策模型,该模型旨在用于评估大型语言模型。然而,该模型在多个公开基准上的表现不佳,在RM-Bench和JudgeBench上的得分接近随机猜测,并在HaluEval上持续将所有项目标记为相同类别。虽然其原始置信度过高,但校准后性能有所提升,但在关键评估中仍与随机猜测无统计学差异。研究还探讨了决策顺序翻转率和长度偏好转移,发现CLM-v0.1-…

  2. TOOL · CL_231597 ·

    新的“模式化”技术可消除 AI 奖励模型的偏差,并显示跨模型迁移能力

    研究人员开发了一种名为“模式化”(patterning)的新技术,用于消除 AI 训练中使用的奖励模型的偏差。该方法根据偏好对基准损失的影响重新加权,从而有效减少风格偏差。将该技术应用于在 Skywork-Reward-Preference v0.2 上训练的 Gemma 2 9B Instruct 模型,在 RM-Bench Hard 基准测试中取得了显著改进,优于先前的方法。学习到的权重还显示出向其他 Gemma 模型迁移的能力,…

  3. TOOL · CL_77334 ·

    AdaJudge框架通过自适应池化改进LLM奖励建模

    研究人员推出AdaJudge,一个旨在提高大型语言模型(LLM)奖励建模准确性的新颖框架。该方法通过自适应模型表示及其聚合方法,解决了当前静态池化策略的局限性。AdaJudge采用门控细化块来创建面向判别的表示,并使用自适应多视角池化模块进行动态证据组合。在RM-Bench和JudgeBench上的实验表明,AdaJudge的性能优于现有的奖励模型和池化基线。

  4. TOOL · CL_79183 ·

    新的SVR框架通过学习判别性评分标准来改进LLM评估

    研究人员开发了一个名为支持向量评分标准(SVR)的新框架,以改进对大型语言模型输出的评估。SVR通过专注于区分排名接近的响应,而不是仅仅描述好的响应,来解决自生成评分标准的局限性。这种方法使用偏好数据来学习评分标准库和条件提示选择器,显著缩小了AI生成和人类定义的评估标准之间的差距。