PulseAugur
实时 10:34:57
实体 human preference datasets

human preference datasets

PulseAugur coverage of human preference datasets — every cluster mentioning human preference datasets across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_167574 ·

    研究发现:AI奖励模型会记住数据集捷径并过度泛化

    一篇新论文研究了判别式训练的奖励模型(RMs)的记忆模式。研究表明,奖励模型倾向于将记忆分配给更简单的偏好对,学习模型身份等特定于数据集的捷径,并过度泛化响应长度等简单启发式方法。这些发现表明,目前在人类偏好数据上训练的奖励模型可能会产生有偏见的判断,并且尚未能熟练地在依赖上下文的情况下评估响应质量。