Qwen2.5-Math-1.5B
PulseAugur coverage of Qwen2.5-Math-1.5B — every cluster mentioning Qwen2.5-Math-1.5B across labs, papers, and developer communities, ranked by signal.
-
新的ReCo方法改进了用于语言模型推理的GRPO
研究人员开发了ReCo,一种新颖的重加权方法,旨在改进语言模型中的Group Relative Policy Optimization (GRPO)。GRPO是一种标准的强化学习技术,但有时会因过度关注高概率响应而降低模型的推理能力。ReCo通过根据响应的预期发生次数进行归一化来处理响应贡献,并用基于方差的比例替换了token级别的importance ratio。这种方法旨在提高推理路径的覆盖率,尤其是在Pass@k等基准测试中k值较大时。
-
新方法使用错误草稿来提升LLM的数学能力
研究人员开发了一种名为“通过不匹配的错误草稿进行弱到强诱导”的新颖技术,以提高大型语言模型的能力。该方法涉及使用来自较小的、特定领域的模型的数学上不正确的草稿来训练一个更大的模型,其性能优于标准的强化学习微调。该技术在MATH-500和分布外AIME 2025/2026基准测试中显示出显著的提升,为Mathstral-7B模型实现了新的最先进水平。
-
新研究推进机器人和LLM的策略优化
研究人员引入了几种新方法来增强强化学习中的策略优化,特别是针对涉及机器人和大型语言模型(LLM)的复杂任务。MODIP旨在通过使用世界模型来指导适应,从而高效地微调机器人学习中的扩散策略,与标准的模仿学习相比,提高了稳定性和性能。N-GRPO和T2-GRPO分别侧重于通过采用新颖的嵌入层混合和多视域奖励策略来改进LLM在数学推理和护理代理等任务中的探索和奖励分配。此外,CATPO和GenPO++通过改进基于树的方法和生成策略来提高训练…
-
Qwen2.5-Math-1.5B模型针对数学任务进行微调
一份技术指南详细介绍了微调Qwen2.5-Math-1.5B模型的过程。文章概述了将此特定语言模型应用于数学任务的步骤,以期提高其性能或定制化以适应特定应用。
-
新的强化学习方法提升大语言模型的推理和效率
两篇新的研究论文介绍了用于增强语言模型推理的新型强化学习技术。第一篇 GAGPO 提出了一种无批评者的方法,用于在多轮环境中进行精确的时间信用分配,从而改进了与步骤对齐的学习。第二篇 CoDistill-GRPO 提出了一种联合蒸馏方法,用于同时训练大型和小型语言模型,使得分组相对策略优化对于小型模型来说更高效、更易于使用。
-
新研究在多语言、长上下文和推理任务中推进大语言模型效率
研究人员正在开发新方法来提高大语言模型(LLMs)在各种应用中的效率和有效性。Google DeepMind 推出了 ATLAS,一个用于缩放多语言模型的框架,该框架在数据混合和模型大小方面提供了指导,以提高非英语语言的性能。Hugging Face 发布了 LFM2.5-Encoders,针对 CPU 上的快速长上下文推理进行了优化,在文本分类等任务的速度和效率方面优于现有模型。此外,几篇 arXiv 论文探讨了大语言模型解码和推理…