MATH500
PulseAugur coverage of MATH500 — every cluster mentioning MATH500 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新AI训练方法无需参数调整即可提升模型推理能力
研究人员开发了一种名为On-Policy Power Distillation (OPPD) 的新颖方法,用于训练语言模型以提高其推理能力,而无需外部评分或参数更改。OPPD直接训练模型生成更优化的答案,有效地将概率转移到模型最可能正确的响应上。该技术在MATH500、GSM8K和HumanEval等多个基准测试中显示出显著的准确性提升,优于GRPO等现有方法,并取得了与广泛候选采样相当的收益。
-
CanvasAnneal框架通过课程强化学习提升扩散语言模型的推理能力
研究人员开发了CanvasAnneal,一个用于扩散语言模型(DLMs)的新框架,该框架使用课程强化学习来提高它们的推理和工具使用能力。这种方法在训练的初始阶段注入来自更强教师模型的指导,并随着DLM学会独立生成推理轨迹而逐渐减少。在MATH500和Countdown等基准测试上的实验表明,CanvasAnneal可以加速奖励的提高,并优于标准的diffu-GRPO,尽管收益因任务而异。
-
新研究表明强化学习增强语言模型采样效率,而非新的推理能力
一项新的研究论文探讨了强化学习(RL)如何影响语言模型的推理能力,特别是它是否引入了新的推理能力还是增强了现有能力的采样。该研究引入了一个统一解码框架(UDF)来分析token级别的采样和搜索策略。在Math500和GPQA等基准测试上的结果表明,RL的收益在很大程度上可归因于现有能力的采样效率提高,而不是全新的推理技能。
-
新的TRACES框架为LLM推理实现成本效益的早期停止
研究人员推出TRACES,一个旨在为语言推理模型(LRM)标记推理步骤的新框架,以实现自适应且成本效益高的早期停止。该方法在推理过程中监控推理行为,识别在达到正确答案后发生的转变。通过分析特定的步骤类型,TRACES可以创建可解释的早期停止标准,在数学和基于知识的基准测试中实现显著的代币减少(20-50%),同时保持准确性。
-
新理论解释了验证器不完美如何影响LLM的测试时扩展
一篇题为“ROC-n-reroll:验证器不完美如何影响测试时扩展”的新论文探讨了通过在推理过程中增加计算量来提高语言模型性能的理论基础。研究证明,像Best-of-N和Rejection Sampling这样的方法的准确性直接关系到验证器ROC曲线的几何形状。使用Qwen和Llama模型在GSM8K和MATH500数据集上进行的实验证实,在固定计算量的情况下,Rejection Sampling比Best-of-N更有效,尽管两种方…
-
新的ROM框架减少AI过度思考,大幅缩短响应时间
研究人员开发了ROM(实时过度思考缓解),一个新颖的框架,旨在防止大型推理模型(LRMs)在达到正确解决方案后进行不必要的计算。ROM利用一个轻量级的隐藏状态检测器,在格式良好的推理边界进行识别和干预,有效缓解“过度思考”,而无需提取中间答案或更新模型权重。这种方法在各种基准测试和模型家族中,将响应长度最多减少77%,同时保持或提高准确性,从而大幅降低实际运行时间延迟。
-
新研究识别RLVR中的pass@k反转,并提出缓解策略
一篇新的研究论文探讨了在可验证奖励强化学习(RLVR)中出现的“pass@k反转”现象。当RLVR提高模型单样本准确率,但降低其在需要多次尝试(更高k)的任务上的表现时,就会发生这种情况。该论文认为这是由于证据缺失导致的失败,即在RLVR训练过程中,稀有的正确轨迹会丢失。一种名为“逐问题基准锚定”(PBA)的提议方法,旨在通过优化提示并根据基准模型的分布锚定高风险提示来缓解这一问题,并在Omni-MATH-Test等基准测试中取得了改进的结果。
-
新研究加速扩散语言模型训练并增强生成能力
研究人员正在探索掩码扩散语言模型(MDMs)的进步,以提高其训练效率和生成能力。一项研究提出了一种“钟形时间采样”策略,可将MDM训练速度提高多达四倍,同时在One Billion Word Benchmark等基准测试中保持性能。另一篇论文介绍了多掩码扩散模型(MultiMDMs),通过保留掩码结构来增强少步生成,从而在精炼为干净标记之前更好地预测指定掩码。此外,一个名为基于轨迹的策略内蒸馏(TOPD)的新框架允许扩散语言模型在没有…
-
新的 Step-Tagging 框架增强了对语言推理模型的控制
研究人员引入了一个名为 Step-Tagging 的新框架,以更好地控制语言推理模型(LRM)的生成过程。该框架使用轻量级句子分类器实时标注推理步骤,并采用一种名为 ReasonType 的新分类法。通过监控特定推理步骤的数量,可以建立有效的提前停止标准,从而在保持 MATH500、GSM8K、AIME、GPQA 和 MMLU-Pro 等基准测试相当准确率的同时,显著减少 token 使用量(20-50%)。这种方法为研究和控制 LR…
-
新的MRP技术提高了语言模型的速度和准确性
来自Modal Research和纽约大学上海分校HeavyBall Research的研究人员开发了一种名为多标记残差预测(MRP)的新技术,该技术提高了语言模型的速度和准确性。MRP通过训练一个小模块来预测扩散语言模型中相邻去噪步骤之间的残差差异,而不是预测整个分布。这种方法在静态模式下可以实现高达1.56倍的吞吐量,并且在动态模式下可以恢复在激进的低阈值解码设置中丢失的重要准确性点,同时几乎没有质量损失。
-
新框架通过模式感知推理提升LLM工具使用能力
一篇新的研究论文介绍了一个模式感知框架,以增强大型语言模型中的工具集成推理(TIR)。该框架通过关注工具的应用方式,而不仅仅是何时使用它们,来解决先前工作中的局限性。它区分了代码使用的计算器模式和算法模式,并提出了一种两阶段方法来构建代码能力并将模式选择与期望的结果对齐。正如在MATH500和AIME24上的Code@1等指标的显著提升所示,该方法在具有挑战性的数学数据集上显著提高了准确性。
-
新方法惩罚冗余,使大语言模型推理更高效
研究人员开发了一种新颖的方法,通过惩罚其思维链(CoT)追踪中的内部和外部冗余来减少大型推理模型(LRM)的“过度思考”。这种双重惩罚强化学习框架分别解决了第一个正确答案之前的信��停滞和之后的冗余延续问题。在GSM8K和MATH500等基准测试上的实验表明,推理长度显著缩短,在1.5B模型上最多可减少41.3%,同时保持了具有竞争力的准确性并提高了整体效率。该方法还显示出对GPQA和LiveCodeBench等域外任务的可迁移性,为…
-
ConPress 方法从多问题提示中学习高效推理
研究人员开发了一种名为 ConPress 的新方法,以提高大型推理模型的效率。该技术利用了一种称为“自压缩”的现象,即模型在单个提示中呈现多个问题时,会自然地产生更短的推理轨迹。ConPress 利用这种多问题压力来微调模型,使其在没有外部监督的情况下生成简洁的推理轨迹。这种方法在推理代币使用量上显示出显著的减少,例如在 MATH500 基准测试上减少了 59%,同时保持了具有竞争力的准确性。
-
新框架统一图像生成能力;研究解决蒸馏挑战
研究人员推出了一种新颖的 on-policy 生成场蒸馏框架 DanceOPD,旨在将文本到图像、局部编辑和全局编辑等多种图像生成能力统一到单个模型中。该框架解决了将这些能力结合起来可能导致性能下降的常见问题。DanceOPD 将样本路由到特定的能力场,并使用速度 MSE 目标进行训练,从而在保持整体生成质量的同时组合专家能力。此外,其他研究还探索了 on-policy 蒸馏技术,包括缓解输出多样性减少和解决长推理任务中的位置偏差的方…
-
新的SIGMA框架通过多代理知识集成提升AI数学推理能力
研究人员开发了SIGMA,一个旨在提高AI代理数学推理能力的新框架。SIGMA采用多代理系统,其中专业代理独立进行推理、执行定向搜索并通过协调者合成信息。这种方法通过让每个代理生成假设性段落来优化检索,从而实现上下文敏感且高效的知识集成。SIGMA在MATH500、AIME和GPQA等具有挑战性的基准测试中表现出色,比现有系统提高了7.4%的绝对性能。
-
新的SEVRA方法优化LLM推理,以提高准确性和效率
研究人员开发了一种名为选择性验证分配推理(SEVRA)的新方法,以优化大型语言模型(LLM)中的推理使用。SEVRA充当服务层控制器,决定是接受模型的初始答案还是进行额外的验证。当在MATH500数据集上使用冻结的Qwen3-4B模型进行测试时,SEVRA在显著减少令牌使用量和有害答案翻转的同时,实现了比总是验证更高的准确性。然而,该研究还发现,增加初始推理预算有时可以比选择性恢复用更少的令牌获得相似或更好的结果,这表明在采用选择性验…
-
新的采样方法在不更新参数的情况下提升了大型语言模型的推理能力
研究人员开发了一种名为熵引导功率采样(EGPS)的新采样方法,以提高基础语言模型的推理能力。该方法通过关注序列内的高熵区域来解决传统Metropolis-Hastings采样器的低效问题,从而实现更快、更有效的采样。EGPS在MATH500、HumanEval和GPQA等基准测试中表现强劲,与现有技术相比实现了显著的加速。
-
新CCPO方法改进了多智能体LLM中的信用分配
研究人员开发了一种名为协作信用策略优化(CCPO)的新方法,以解决多智能体大型语言模型(LLM)系统中信用分配的挑战。CCPO充当一个与优化器无关的层,将团队层面的结果转换为智能体特定的学习信号。它采用两个分配器:一个通过模拟智能体的移除来估计其边际贡献,另一个使用约束的自我评估和同伴评估。该方法在双智能体推理任务中显示出改进,特别是在MATH500等数学基准测试上,根据所使用的模型和数据集,收益有所不同。
-
新的ScaleSearch方法通过优化量化提高了生成模型的效率
研究人员开发了一种名为ScaleSearch的新方法,通过量化来提高生成模型的效率。该技术优化了块浮点(BFP)格式中尺度因子的选择,将量化误差降低了高达27%。提出的ScaleSearchAttention算法与BFP集成,在因果语言建模中表现出接近零的性能损失,并在Qwen3-8B和Llama 3.1 70B等模型的准确性方面显示出显著的改进。
-
AI模型使用策略引导路由进行成本效益数学推理
研究人员通过实施策略引导分步模型路由系统,开发了一种在大型语言模型中实现成本效益推理的新方法。该方法将中间思维链状态路由到不同大小模型的任务,构建为一个受约束的决策问题。通过使用强化学习训练一个小型控制策略并采用阈值校准,该系统优化了性能-效率的权衡,优于手工制作的策略,并能与训练了更大奖励模型的方法相媲美。