PulseAugur
实时 09:23:24
English(EN) Improving Generalization Robustness of Multimodal RLVR

新的RLVR方法增强LLM鲁棒性和泛化能力 · 跟踪2个来源

研究人员开发了新的方法来提高多模态大语言模型(LLM)的强化学习可验证奖励(RLVR)的鲁棒性和泛化能力。第一种方法是提示不变RLVR(PIRL),它将奖励信号中的格式与内容分离,并在语义等价的提示上应用策略不变性,与GRPO相比,在压力测试下准确率下降显著减少。第二种方法是扰动参数策略优化(3PO),它通过从后验采样不同的策略来探索参数空间,在OLMo-3-1025-7B和Qwen2.5-Math-7B等模型的数学推理和代码生成等下游任务中,已显示出一致的性能提升,同时计算成本增加极少。 AI

影响 这些进展可以通过提高LLM在不同输入下泛化和保持准确性的能力,从而在复杂、高风险的应用中实现更可靠、性能更优的LLM。

排序理由 两篇研究论文提出了改进大型语言模型强化学习的新颖方法。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →

新的RLVR方法增强LLM鲁棒性和泛化能力 · 跟踪2个来源

报道来源 [2]

  1. arXiv cs.AI TIER_1 English(EN) · Pengfei Zhou, Zhiwei Tang, Xiaopeng Peng, Chenrui Zhou, Lama Moukheiber, Yixing Ma, Bin Xu, Jiajun Song, Zhenglin Wan, Wangbo Zhao, Jiasheng Tang, Bohan Zhuang, Fan Wang, Yang You ·

    Improving Generalization Robustness of Multimodal RLVR

    arXiv:2608.08802v1 Announce Type: new Abstract: Reinforcement Learning with Verifiable Rewards (RLVR) makes Multimodal Large Language Models more accurate, but the gains are brittle: simply paraphrasing a question or changing the prompt template can degrade them, which challenges…

  2. arXiv cs.AI TIER_1 English(EN) · Vatsal Venkatkrishna, Nico Daheim, Iryna Gurevych ·

    参数探索用于通过变分学习的RLVR

    arXiv:2608.09805v1 Announce Type: cross Abstract: Exploration has been a focus of reinforcement learning research for a long time. Recently, there has been growing evidence that it is also an important ingredient in LLM reinforcement learning recipes that can significantly impact…