研究人员开发了新的方法来提高多模态大语言模型(LLM)的强化学习可验证奖励(RLVR)的鲁棒性和泛化能力。第一种方法是提示不变RLVR(PIRL),它将奖励信号中的格式与内容分离,并在语义等价提示上应用策略不变性,与GRPO相比,在压力测试下准确率下降显著降低。第二种方法是扰动参数策略优化(3PO),它通过从后验采样不同的策略来探索参数空间,在OLMo-3-1025-7B和Qwen2.5-Math-7B等模型上,对于数学推理和代码生成等下游任务,在计算成本略有增加的情况下,表现出了一致的性能提升。 AI
影响 这些进展通过提高LLM在多样化输入下泛化和保持准确性的能力,有望在复杂、高风险的应用中实现更可靠、更高性能的LLM。
排序理由 两篇研究论文提出了改进大语言模型强化学习的新方法。
- arXiv
- GRPO
- Hugging Face
- Multimodal Large Language Models
- OLMo-3-1025-7B
- PIRL
- Qwen2.5-Math-7B
- Reinforcement Learning with Verifiable Rewards
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →