实体
CRPO
CRPO
PulseAugur coverage of CRPO — every cluster mentioning CRPO across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 2
层级分布 · 90 天
主题
情绪 · 30 天
1 天有情绪数据
最近 · 第 1/1 页 · 共 2 条
-
新研究解决大语言模型对齐成本和跨语言数据挑战
两篇新研究论文探讨了改进大语言模型(LLMs)与人类偏好对齐的方法。第一篇论文BALIGN提出了一种选择偏好数据以减轻“对齐成本”的策略,该成本会导致大语言模型忘记预训练能力。BALIGN使用基于参考模型对数概率差和词元长度差异等因素的复合风险评分来过滤掉有问题的数据。第二篇论文CRPO解决了以英语为中心的偏好数据问题,提出了一种跨语言框架,利用英语偏好来改进其他语言的对齐。CRPO使用分层结构和响应的相对排序来增强跨多种语言的适应性和性能。
-
新的CRPO框架提升了LLM的角色扮演保真度
研究人员推出了一种名为面向角色的群体相对策略优化(CRPO)的新型框架,旨在提升大型语言模型(LLM)的角色扮演能力。CRPO解决了现有以问题为中心的优化方法中常见的角色保真度丢失和风格崩溃的问题。该框架通过将任务逻辑与风格化奖励解耦,根据角色复杂性调整优化约束,并使用通用响应作为负面基线以保持角色一致性,从而实现这一目标。实验表明,CRPO在保持角色一致性和情感表达方面优于现有方法。