Qwen2.5-Math-7B
PulseAugur coverage of Qwen2.5-Math-7B — every cluster mentioning Qwen2.5-Math-7B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
ScalePRM 在无需真实标签的情况下训练 AI 奖励模型,性能优于 GPT-4o
研究人员开发了 ScalePRM,一种新颖的训练过程奖励模型(PRMs)的方法,该方法绕过了昂贵的步骤级正确性标签或真实标签的需要。该方法通过生成和聚合每个推理步骤的多个独立验证来创建合成标签,从而扩展了验证计算。ScalePRM 在 ProcessBench 基准测试上取得了 67.5 的 F1 分数,性能优于传统的基于真实标签的训练,甚至优于作为批评者的 GPT-4o。当用作 Qwen2.5-Math-7B 的 RL 训练的奖励信…
-
新的RLVR方法增强LLM的鲁棒性和泛化能力 · 跟踪2个来源
研究人员开发了新的方法来提高多模态大语言模型(LLM)的强化学习可验证奖励(RLVR)的鲁棒性和泛化能力。第一种方法是提示不变RLVR(PIRL),它将奖励信号中的格式与内容分离,并在语义等价提示上应用策略不变性,与GRPO相比,在压力测试下准确率下降显著降低。第二种方法是扰动参数策略优化(3PO),它通过从后验采样不同的策略来探索参数空间,在OLMo-3-1025-7B和Qwen2.5-Math-7B等模型上,对于数学推理和代码生成…
-
新的 GRPO 方法改进了 AI 模型在数学任务中的信用再分配
研究人员开发了一种名为稀有度感知信用再分配用于 GRPO (GRPO) 的新方法,以解决具有可验证奖励的强化学习中的信用集中问题。该方法根据重复的正确解形式的稀有度来重新分配学习信号,防止常见解累积过多的正系数。该实现 Cue-GRPO 使用确定性策略提示来创建已验证正确的轨迹分区,在 Qwen2.5-Math-7B 和 Llama 3.1 8B-Instruct 等模型的竞赛数学任务上提高了性能,而训练开销却很小。
-
新课程方法提升AI模型数学解题能力
研究人员开发了一种名为“问题引出问题”(Question-begets-Question, QbQ)的新型自演化课程方法,以提高语言模型在竞赛数学等复杂任务上的性能。该方法通过生成多样化的问题变体,解决了数据稀缺和模型训练中常见的平台期效应。通过将强化学习集中在模型大部分能解决的问题上,QbQ 已被证明能够突破性能瓶颈,显著提高模型的解题能力,且没有饱和迹象。
-
新的ReCo方法改进了用于语言模型推理的GRPO
研究人员开发了ReCo,一种新颖的重加权方法,旨在改进语言模型中的Group Relative Policy Optimization (GRPO)。GRPO是一种标准的强化学习技术,但有时会因过度关注高概率响应而降低模型的推理能力。ReCo通过根据响应的预期发生次数进行归一化来处理响应贡献,并用基于方差的比例替换了token级别的importance ratio。这种方法旨在提高推理路径的覆盖率,尤其是在Pass@k等基准测试中k值较大时。
-
新的采样方法在不更新参数的情况下提升了大型语言模型的推理能力
研究人员开发了一种名为熵引导功率采样(EGPS)的新采样方法,以提高基础语言模型的推理能力。该方法通过关注序列内的高熵区域来解决传统Metropolis-Hastings采样器的低效问题,从而实现更快、更有效的采样。EGPS在MATH500、HumanEval和GPQA等基准测试中表现强劲,与现有技术相比实现了显著的加速。
-
新的强化学习方法提升大语言模型的推理和效率
两篇新的研究论文介绍了用于增强语言模型推理的新型强化学习技术。第一篇 GAGPO 提出了一种无批评者的方法,用于在多轮环境中进行精确的时间信用分配,从而改进了与步骤对齐的学习。第二篇 CoDistill-GRPO 提出了一种联合蒸馏方法,用于同时训练大型和小型语言模型,使得分组相对策略优化对于小型模型来说更高效、更易于使用。
-
新理论解释RLVR优化动力学和步长阈值
研究人员开发了一个用于可验证奖励强化学习(RLVR)的理论框架,这是一种用于通过二元反馈微调大型语言模型的技巧。该研究引入了一个“梯度间隙”指标来分析训练过程,并确定了一个关键的收敛步长阈值。该理论解释了响应长度和成功率等因素如何影响学习稳定性,并预测在固定学习率下可能无法达到100%的成功率。
-
新的RLVR方法通过正负提示配对增强LLM推理能力
研究人员开发了一种名为提示高效RLVR的新方法,可改进大型语言模型在推理任务上的训练。该技术侧重于选择同时提供积极锚点和来自罕见失败信号的提示,这与以往基于方差的方法不同。通过配对“难但可解”和“易但脆弱”的提示,并使用加权方法来放大成功和失败,该方法提高了样本效率,并在数学推理基准测试中取得了显著的性能提升。
-
新的平衡聚合方法改进了 LLM 的 GRPO 训练
研究人员已识别并提出了 GRPO 风格训练中聚合偏差的解决方案,这是一种用于增强大型语言模型推理和代码生成的方法。研究表明,标准的 GRPO 聚合方法,即序列聚合和标记聚合,会引入不同的优化偏差。为了对抗这种偏差,他们引入了平衡聚合(BA),这是一种即插即用的替代方案,可提高训练稳定性和性能。使用 Qwen2.5-Math-7B 和 Qwen3-1.7B 模型进行的实验证明了 BA 在各种推理和编码基准测试中的有效性。
-
新研究在多语言、长上下文和推理任务中推进大语言模型效率
研究人员正在开发新方法来提高大语言模型(LLMs)在各种应用中的效率和有效性。Google DeepMind 推出了 ATLAS,一个用于缩放多语言模型的框架,该框架在数据混合和模型大小方面提供了指导,以提高非英语语言的性能。Hugging Face 发布了 LFM2.5-Encoders,针对 CPU 上的快速长上下文推理进行了优化,在文本分类等任务的速度和效率方面优于现有模型。此外,几篇 arXiv 论文探讨了大语言模型解码和推理…