研究人员在通过可验证奖励强化学习(RLVR)训练的大型语言模型中发现了一种称为灾难性策略崩溃的现象。当GRPO等算法过度限制模型的推理能力,导致不同策略无法访问时,就会发生这种崩溃。为了解决这个问题,开发了一种名为Mesh Learning的新方法,该方法鼓励保留多种推理策略。在AIME26和GPQA等基准测试上的实验表明,当应用于Qwen和Phi Llm等模型时,Mesh Learning的性能明显优于现有方法。 AI
影响 保留模型策略容量,可能为复杂推理任务带来更强大、更多功能的LLM。
排序理由 详细介绍LLM新训练方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AIME25
- AIME26
- GPQA: A Graduate-Level Google-Proof Q&A Benchmark
- Grpo
- LiveCodeBench
- Math-500
- Mesh Learning
- Mirrored Entanglement Index (MEI)
- Phi Llm
- Qwen
- RLVR
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →