PulseAugur
实时 09:58:32
实体 UniRRM-14B

UniRRM-14B

PulseAugur coverage of UniRRM-14B — every cluster mentioning UniRRM-14B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. TOOL · CL_244930 ·

    UniRRM模型为开放式AI任务提供统一的多语言推理

    研究人员推出了UniRRM,这是一种统一的推理奖励模型,旨在克服当前开放式任务奖励建模的局限性。UniRRM通过采用分阶段的推理链来动态生成特定任务的标准,从而支持多种语言和评估范式。这种方法允许进行细粒度的、输入自适应的判断,并且在不同语言之间保持一致。该模型(包括UniRRM-8B和UniRRM-14B变体)在各种基准测试中的表现与同等规模的SOTA模型相当,并被证明对新颖的评估范式有效。