研究人员开发了新的方法来提高多模态大语言模型(LLM)的强化学习可验证奖励(RLVR)的鲁棒性和泛化能力。第一种方法是提示不变RLVR(PIRL),它将奖励信号中的格式与内容分离,并在语义等价的提示上应用策略不变性,与GRPO相比,在压力测试下准确率下降显著减少。第二种方法是扰动参数策略优化(3PO),它通过从后验采样不同的策略来探索参数空间,在OLMo-3-1025-7B和Qwen2.5-Math-7B等模型的数学推理和代码生成等下游任务中,已显示出一致的性能提升,同时计算成本增加极少。 AI
影响 这些进展可以通过提高LLM在不同输入下泛化和保持准确性的能力,从而在复杂、高风险的应用中实现更可靠、性能更优的LLM。
排序理由 两篇研究论文提出了改进大型语言模型强化学习的新颖方法。
- arXiv
- GRPO
- Hugging Face
- Multimodal Large Language Models
- OLMo-3-1025-7B
- PIRL
- Qwen2.5-Math-7B
- Reinforcement Learning with Verifiable Rewards
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →