实体
SelectiveRM
SelectiveRM
PulseAugur coverage of SelectiveRM — every cluster mentioning SelectiveRM across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
SelectiveRM 框架训练奖励模型忽略嘈杂偏好
来自浙江大学、小红书和北京大学的研究人员开发了 SelectiveRM,一个用于训练大型语言模型奖励模型的新颖框架。该方法通过使用最优传输来选择性地对齐分布,解决了人类和 AI 生成反馈中常见的嘈杂偏好数据的问题。SelectiveRM 识别并丢弃冲突的嘈杂偏好,使模型能够学习更可靠的奖励函数,并提高下游人类反馈强化学习 (RLHF) 的安全性。
-
新研究探索用于大型语言模型和扩散模型的先进奖励建模
几篇新研究论文探讨了用于人工智能对齐的奖励建模的进展,特别是针对大型语言模型和扩散模型。其中一篇论文介绍了SelectiveRM,一个使用最优传输来处理奖励建模中嘈杂的人类偏好的框架。另一篇论文CAMEL提出了一种置信门控反射方法,选择性地对低置信度实例调用反射,以更少的参数实现了最先进的准确性。此外,还开发了一个名为RMGAP的新基准来评估奖励模型在不同用户偏好上的泛化能力,揭示了当前模型的重大局限性。最后,ArenaPO利用Are…