PulseAugur
实时 10:14:22
实体 OLMo-3-1025-7B

OLMo-3-1025-7B

PulseAugur coverage of OLMo-3-1025-7B — every cluster mentioning OLMo-3-1025-7B across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 1
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 1 条
  1. RESEARCH · CL_193355 ·

    新的RLVR方法增强LLM鲁棒性和泛化能力 · 跟踪2个来源

    研究人员开发了新的方法来提高多模态大语言模型(LLM)的强化学习可验证奖励(RLVR)的鲁棒性和泛化能力。第一种方法是提示不变RLVR(PIRL),它将奖励信号中的格式与内容分离,并在语义等价的提示上应用策略不变性,与GRPO相比,在压力测试下准确率下降显著减少。第二种方法是扰动参数策略优化(3PO),它通过从后验采样不同的策略来探索参数空间,在OLMo-3-1025-7B和Qwen2.5-Math-7B等模型的数学推理和代码生成等下…