实体
Crpl
Crpl
PulseAugur coverage of Crpl — every cluster mentioning Crpl across labs, papers, and developer communities, ranked by signal.
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的CRPL框架增强了大语言模型的指令遵循能力
研究人员推出了一种名为跨关系偏好学习(CRPL)的新框架,旨在提高大型语言模型(LLMs)遵循复杂指令的能力。CRPL通过显式建模不同指令响应空间之间的关系,解决了当前偏好学习方法的局限性。这通过诸如跨关系扰动和跨区域配对采样等技术实现,这些技术生成更多样化的偏好数据并捕捉更广泛的约束变化。该框架还包括一个基于原子约束的验证机制,用于构建高质量的偏好对,并在各种LLM骨干模型和基准测试中展示了显著的改进和强大的泛化能力。
-
ReCode框架通过奖励推理过程来增强AI代码生成
研究人员开发了ReCode,一个新颖的强化学习框架,旨在通过关注推理过程来改进代码生成。该框架使用对比推理过程奖励学习(CRPL)在合成的推理变体上训练奖励模型,并使用一致性门控GRPO(CG-GRPO)来整合这些奖励,同时通过执行结果缓解奖励攻击。ReCode应用于一个7B模型时,比其基础版本提高了16.1%,并在各种基准测试上取得了与GPT-4-Turbo相当的性能。