研究人员推出 PACS,一个用于可验证奖励强化学习 (RLVR) 的新颖框架,旨在提高大型语言模型 (LLM) 的推理能力。PACS 将 RLVR 重构为一项监督学习任务,使用交叉熵损失优化评分函数,从而固有地恢复稳定的策略梯度更新。实验表明,PACS 在现有开源模型和 RLVR 基线模型上的表现显著优于它们,在 4B 和 8B 模型上分别取得了超过 8% 和 9% 的显著提升。 AI
影响 该框架有望为复杂推理任务带来更强大、更高效的 LLM。
排序理由 该集群包含一篇学术论文,详细介绍了改进 LLM 能力的新框架。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →