研究人员推出了UniRRM,这是一种统一的推理奖励模型,旨在克服当前开放式任务奖励建模的局限性。UniRRM通过采用分阶段的推理链来动态生成特定任务的标准,从而支持多种语言和评估范式。这种方法允许进行细粒度的、输入自适应的判断,并且在不同语言之间保持一致。该模型(包括UniRRM-8B和UniRRM-14B变体)在各种基准测试中的表现与同等规模的SOTA模型相当,并被证明对新颖的评估范式有效。 AI
影响 增强了AI奖励模型在复杂、开放式任务中的多语言能力和可解释性。
排序理由 该集群包含一篇详细介绍新模型和数据集的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →