PulseAugur
中
实时 00:25:53
实体 Pirl

Pirl

PulseAugur coverage of Pirl — every cluster mentioning Pirl across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_193355 ·

    新的RLVR方法增强LLM的鲁棒性和泛化能力 · 跟踪2个来源

    研究人员开发了新的方法来提高多模态大语言模型(LLM)的强化学习可验证奖励(RLVR)的鲁棒性和泛化能力。第一种方法是提示不变RLVR(PIRL),它将奖励信号中的格式与内容分离,并在语义等价提示上应用策略不变性,与GRPO相比,在压力测试下准确率下降显著降低。第二种方法是扰动参数策略优化(3PO),它通过从后验采样不同的策略来探索参数空间,在OLMo-3-1025-7B和Qwen2.5-Math-7B等模型上,对于数学推理和代码生成…

  2. TOOL · CL_204316 ·

    新的RLVR方法增强了多模态LLM在提示变化下的鲁棒性

    研究人员开发了一种名为提示不变RLVR(PIRL)的新方法,以提高多模态大语言模型(MLLMs)在使用可验证奖励强化学习(RLVR)时的鲁棒性。标准的RLVR方法很脆弱,提示的微小变化会显著降低性能,这对于高风险应用来说是个问题。PIRL通过在奖励信号中分离内容和格式,并训练模型对语义等价的提示变化保持不变来解决这个问题。与GRPO等现有方法相比,这种方法在压力测试和动态评估下表现出显著更好的性能。

  3. TOOL · CL_162265 ·

    物理信息强化学习在MATLAB演示中将控制误差减少30%

    研究人员开发了一种物理信息强化学习(PIRL)方法,将物理定律融入学习过程。该方法使用MATLAB进行演示,显示出将物理系统中的控制误差显著减少约30%的潜力。PIRL方法旨在通过确保其输出符合基本物理原理,来超越将强化学习视为黑箱的做法。