PulseAugur
中
实时 23:20:24
实体 RubricBench

RubricBench

PulseAugur coverage of RubricBench — every cluster mentioning RubricBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 2 条
  1. TOOL · CL_274559 ·

    评分标准反应理论通过项目反应建模增强RL奖励

    研究人员引入了评分标准反应理论(RRT),这是一种在需要人类判断的强化学习任务中生成奖励的新颖方法。与对评分标准项求和的传统方法不同,RRT采用双参数项目反应模型,从判断模式中推断出标量质量分数。该方法以Qwen3.5-4B模型为证,在各种数据集上,尤其是在医学和科学领域,显示出优于Group Relative Policy Optimization (GRPO)的性能。RRT还通过自适应Fisher选择减少了所需的判断次数,从而提高了效率。

  2. TOOL · CL_79183 ·

    新的SVR框架通过学习判别性评分标准来改进LLM评估

    研究人员开发了一个名为支持向量评分标准(SVR)的新框架,以改进对大型语言模型输出的评估。SVR通过专注于区分排名接近的响应,而不是仅仅描述好的响应,来解决自生成评分标准的局限性。这种方法使用偏好数据来学习评分标准库和条件提示选择器,显著缩小了AI生成和人类定义的评估标准之间的差距。