Math-500
PulseAugur coverage of Math-500 — every cluster mentioning Math-500 across labs, papers, and developer communities, ranked by signal.
5 天有情绪数据
-
AI模型评估指标pass@k因多样性和能力保留问题受到质疑
一项新的研究论文质疑了pass@k指标在评估AI模型方面的有效性,特别是在训练后微调之后。研究表明,虽然pass@k可能显示出边际改进,但它未能捕捉到输出多样性和能力保留等关键方面。使用Qwen2.5-1.5B-Instruct模型在数学问题上的实验显示,不同的微调方法导致多样性度量出现相反的趋势,但pass@k指标在硬问题覆盖率方面并未显示出明显的赢家或显著改进。该论文认为,pass@k可能具有误导性,尤其是在评估正确答案的多样性时…
-
新的Mesh Learning方法可防止RLVR训练的LLM出现策略崩溃
研究人员在通过可验证奖励强化学习(RLVR)训练的大型语言模型中发现了一种称为灾难性策略崩溃的现象。当GRPO等算法过度限制模型的推理能力,导致不同策略无法访问时,就会发生这种崩溃。为了解决这个问题,开发了一种名为Mesh Learning的新方法,该方法鼓励保留多种推理策略。在AIME26和GPQA等基准测试上的实验表明,当应用于Qwen和Phi Llm等模型时,Mesh Learning的性能明显优于现有方法。
-
新的HEST方法使用双曲几何来提升LLM的数学解题能力
研究人员开发了一种名为双曲熵引导(HEST)的新方法,以提高大型语言模型在解决数学问题时的准确性。HEST利用双曲空间的几何特性来表示LLM推理中的分层分支,特别是在高下一词熵的点上。通过在模型自身的熵上训练一个轻量级探针,HEST沿测地线选择性地修改隐藏状态,从而在Qwen2.5-Math和Llama-3.1等模型的MATH-500和GSM8K等基准测试中提高了准确性。
-
新数据集SymCE训练LLM生成数学反例
研究人员开发了SymCE,这是一个新的数据集和训练环境,旨在提高大型语言模型生成数学定理反例的能力。该方法使用逐定理符号验证器作为奖励函数,解决了模型能够解决正向问题但无法证伪相关错误陈述的已知局限性。使用SymCE和强化学习(特别是GRPO)进行训练表明,虽然单独的监督微调会降低模型在正确定理上的性能,但强化学习能有效修复这一点并增强反例生成能力。
-
新研究衡量 Token 计算成本,揭示优化潜力
一篇新的研究论文提出了一种混合代理(Mixture-of-Agents, MoA)方法来衡量大型语言模型生成单个 Token 的实际计算成本。研究发现,很大一部分计算成本集中在一小部分 Token 上,这表明当前模型可以进行优化。通过使用这种 MoA 导出的映射,模型路由和草稿技术可以在保持或提高准确性的同时,减少延迟和 Token 使用量。
-
训练数据提示解锁基础模型推理能力,可媲美RL性能
研究人员发现,基础模型响应中的特定起始标记可以显著提高其推理能力,使其性能接近通过强化学习(RL)训练的模型。通过操纵这些标记提示,例如使用“\n\nOkay”或“Alright,”,在MATH-500等数学基准测试上的性能可以大幅提升。研究进一步揭示,这些提示是从训练数据中学习到的,而RL训练使它们出现的概率更高。对训练数据进行因果干预甚至可以将任意词语变成有效的推理提示,这表明数据内容与模型行为(包括安全相关响应)之间存在直接联系。
-
小型语言模型在TalkMesh系统中学会沟通与协作
研究人员开发了TalkMesh系统,该系统利用强化学习使小型语言模型能够进行沟通与协作。这种去中心化的代理网络学会何时以及分享何种信息,从而提高了准确性,超越了简单的多数投票。在测试中,TalkMesh在GSM8K和MATH-500等基准测试上的准确性高于单个模型或标准的自洽性方法,并表现出对对抗性串通的抵抗力。
-
新方法提升大语言模型推理效率与准确性 · 跟踪4个来源
研究人员正在开发新方法来提高大语言模型的效率和推理能力。一种名为ReHoPER的方法会在提供最终答案之前,沿着多条路径生成并回答中间问题,在组合推理任务上显示出优势。另一种名为Settle的方法,训练模型判断其推理何时稳定,在MATH-500数据集上将token数量减少了40%,准确率损失极小。第三种技术使用自监督置信度训练,鼓励模型预测其对答案的置信度,在不明确优化缩短推理的情况下,在各种模型和基准测试中实现了高达25%的效率提升。
-
7B模型ZGCM-1优先考虑工具使用和大型上下文,而非记忆
来自中关村学院和中关村人工智能研究院的研究人员开发了ZGCM-1,一个拥有73.9亿参数的模型,该模型优先考虑工具使用和大型上下文窗口,而不是记忆海量数据集。这种方法允许较小的模型通过按需检索信息来执行复杂任务,而不是试图将其内部存储。ZGCM-1利用混合注意力机制和FP8 Muon优化器,在其256K上下文窗口内实现高效处理,在搜索和数学基准测试中表现出色,可与更大模型相媲美。
-
Qwen 3 4B Base模型经过谜题微调后,在MATH-500上提升31%
Qwen 3 4B Base模型的一个微调版本在用100个斑马谜题训练后,在MATH-500基准测试上表现出31%的提升。复现此结果的过程(在单块NVIDIA H100或H200 GPU上耗时约6.5分钟)已公开。这表明专门的微调可以显著提高模型在特定推理任务上的性能。
-
R1 1776 在 MATH-500 基准测试中取得 95.4% 的成绩
AI 模型 R1 1776 在 MATH-500 基准测试中取得了 95.4% 的分数。此性能已获得独立验证,并可在 olud.ai 排行榜上与其他模型进行比较。
-
使用多求解器分歧奖励训练的AI推理系统表现出改进的性能
研究人员开发了一种新颖的AI推理系统训练方法,通过利用多个模型之间的分歧来生成具有挑战性的问题。这种方法称为多求解器分歧奖励,与之前依赖单一模型不确定性的方法形成对比,后者可能导致学习信号崩溃。通过采用具有不同能力和采样温度的集成模型,该系统可以识别出求解器产生冲突答案的问题,从而创建更有效的课程。在Qwen3-4B模型上的实验表明,在竞赛数学基准测试上有了显著的改进,这表明该技术在开发更强大的AI推理能力方面具有潜力。
-
AI研究在推理、优化和移动基准测试方面取得进展
研究人员正在探索用于改进AI推理和统计分析的高级技术,特别是在资源受限的环境中。一篇论文介绍了IMABO,一个在线超参数优化(OHPO)框架,可在实时推理过程中调整配置,并以LLM代理进行了演示。另一项研究侧重于由预测驱动的条件推理,利用机器学习预测器来提高低数据场景下的统计准确性。第三篇论文提出了一种合成增强推理方法,学习一个尺寸-权重前沿,以确保在使用合成数据时获得可靠的结果。此外,一项基准测试工作评估了手机上的小型AI模型,同时…
-
新的RODE优化器解耦神经网络训练动态
研究人员推出RODE,一种用于神经网络的新型优化引擎,它将矩阵更新的径向和方向分量解耦。这种分离允许不同的更新规则和步长,从而实现更有效和可控的训练。在GPT-2上的实验证明了在范数控制和方向更新方面的改进,而在语言建模和图像分类任务上的比较显示RODE的性能优于Muon变体,实现了更低的损失和最终的全局范数。
-
新研究揭示多语言LLM数学训练奖励中的偏见
一篇新研究论文指出,在多语言可验证奖励强化学习(RLVR)中存在显著偏见,RLVR是训练大型语言模型进行数学推理的常用技术。研究发现,旨在语言中立的精确匹配验证器,在日语、英语和标准中文等语言中,会以不同速率错误地惩罚正确答案。这种偏见局限于最终答案界面,并造成了跨语言选择瓶颈,阻碍了有效训练。研究人员建议在优化之前,按语言和界面审计RLVR奖励,以解决这些问题。
-
新方法TAM减少了语言模型推理的内存使用
研究人员开发了一种名为思维感知注意力匹配(TAM)的新方法,以解决语言模型中由长推理序列引起的内存瓶颈问题。TAM将推理轨迹分割成块,根据片段重要性分配压缩预算,并保护关键标记。在Qwen3-4B的数学推理数据集上的实验表明,与均匀压缩方法相比,TAM将峰值内存使用量减少了65%,同时保持了具有竞争力的准确性。
-
印度AI模型在旧基准上表现强劲,在新评估中落后
一篇新论文通过分析公开报告的基准结果,评估了印度基础模型的进展。虽然印度模型在MMLU和MATH-500等既有基准上表现强劲,但在参与较新、更专业的评估方面却落后。该研究提出了一个基准成熟度指数(BMI),用于评估基准的标准化、参与度、验证和国家覆盖范围,并提出明显的性能差距可能源于评估生态系统的不足。在接受调查的印度组织中,Sarvam AI 在基准覆盖范围方面最为广泛。
-
新指标衡量LLM特征的语义抽象度
研究人员引入了一个名为特征非局部性(FNL)的新指标,以更好地理解大型语言模型(LLM)中稀疏自编码器(SAE)内特征的语义抽象度。FNL衡量了位置对特征激活影响的熵,有助于区分高级概念特征和简单的由token驱动的特征。该指标在评估机制性解释方面显示出潜力,并通过引导高FNL特征在MATH-500基准测试等任务上提高了性能。
-
新的压力测试方法揭示了AI奖励模型的漏洞
研究人员开发了一种新的方法来对AI训练和搜索中使用的过程奖励模型(PRMs)进行压力测试。这种利用MAP-Elites的质量-多样性搜索方法旨在识别和量化模型通过提高奖励分数同时引入错误推理来利用PRMs的漏洞。研究表明,虽然这种方法可以限制某些风险,但仅凭覆盖率不能保证避免最坏情况。在Qwen2.5-Math-PRM-7B模型上的实验揭示了与聚合方法相关的重大漏洞,这些漏洞后来通过对抗性微调得到了缓解。
-
新的DRBENCHER基准测试AI代理的综合浏览和数学技能
研究人员推出了DRBENCHER,这是一个旨在评估AI代理结合网络浏览和多步数学计算能力的基准。与以往单独评估这些技能的基准不同,DRBENCHER从知识图中综合问题,要求代理识别实体、检索属性并执行特定领域的计算。该基准涵盖五个领域:生物化学、金融、地球物理学、安全和历史。人工评估显示有效率为76%,其中相当一部分错误归因于过时的知识图数据,而即使是先进的前沿模型在该基准上的准确率也仅为20%。