AIME 2025
PulseAugur coverage of AIME 2025 — every cluster mentioning AIME 2025 across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新研究质疑了当候选答案错误时大型语言模型的聚合策略
一篇新研究论文探讨了大型语言模型不同聚合策略的有效性,特别是在初始候选答案不正确的情况下。该研究使用 Qwen3-4B 模型在 AIME-2025 和 HMMT-2025 数学基准测试上进行,发现虽然以多个正确候选答案为条件可以提高准确性,但依赖不正确的候选答案实际上会降低性能,与生成全新解决方案相比。研究还指出,显式答案字段可以引导模型输出,但掩盖它们并未带来可衡量的准确性改进。
-
新研究探索LLM推理的测试时扩展
两篇新研究论文介绍了通过测试时扩展来提高大型语言模型(LLMs)推理能力的新颖方法。第一篇论文“Consilience”通过引入一个评估置信度时间不对称性的框架,惩罚初始高置信度但要求最终确定性,从而解决了现有基于置信度方法的局限性。第二篇论文“CoBa”提出了一种计算平衡的路由策略,优化了生成和验证步骤的资源分配,以显著更少的计算资源实现了高精度。
-
新的 TTEL 算法通过定位错误来提高 LLM 推理效率
研究人员开发了一种名为“通过错误定位进行测试时扩展”(TTEL)的新型推理时算法,以提高大型语言模型在复杂推理任务上的效率。TTEL 利用反馈来精确定位错误发生的具体 token,从而能够截断错误的路径并为新生成的内容重用有效的词缀。评估表明,TTEL 在 LiveCodeBench、AIME-2025 和 HMMT-2025 等基准测试中显著优于现有方法,以更少的生成 token 实现了更好的性能。
-
KV-Cache嫁接提升小型LLM,实现280万token上下文
研究人员开发了一种名为KV-Cache嫁接的新颖技术,可以在不改变权重的情况下增强小型语言模型。该方法允许将已验证的知识以字节精确的方式恢复到推理上下文中,从而在能力和效率方面取得显著改进。例如,Gemma-4-12B模型在AIME 2025基准测试上的性能在嫁接了已验证的解决方案库后,从80.0%提高到93.3%。这种方法还大大减少了token使用量和能耗,使得上下文窗口高达280万token,而无需额外的内存成本。
-
新的ACPO框架增强了大型语言模型的强化学习能力
研究人员推出了一种名为自适应信用策略优化(ACPO)的新框架,旨在改进大型语言模型强化学习中的信用分配。ACPO通过不对称地调整策略更新来解决稀疏奖励的挑战,重点关注成功试验中的不确定决策和失败试验中的过度自信的token。该方法旨在在保持策略梯度方向的同时,提高在AIME 2025和HumanEvalPro等基准测试上的性能,优于DAPO、GTPO和SAPO等现有方法。
-
TREK程序提升AI推理和代理任务性能
一种名为TREK(Teacher-Routed Exploration via Forward KL)的新分阶段程序已被引入,以提高AI模型的性能,尤其是在复杂的推理任务中。TREK利用蒸馏并非为了直接模仿,而是通过整合已验证的解决方案来扩展模型的探索能力。该方法在应用于DeepSeek-V4和Qwen3等模型时,在AIME 2024和2025等数学推理基准上显示出显著改进,并且还增强了在ALFWorld和ScienceWorld等代…
-
TREK方法通过扩展探索支持来提升LLM推理能力
研究人员推出了一种新颖的分阶段程序TREK(Teacher-Routed Exploration via Forward KL),旨在增强语言模型的能力,特别是在复杂的推理任务中。TREK利用蒸馏并非为了直接模仿,而是为了扩展模型的探索支持,使其能够处理当前策略可能 falter 的提示。该方法在应用于Qwen3等模型时,在AIME 2024和AIME 2025等数学推理基准上显示出显著的改进,并且还提高了ALFWorld和Scien…
-
新方法使用错误草稿来提升LLM的数学能力
研究人员开发了一种名为“通过不匹配的错误草稿进行弱到强诱导”的新颖技术,以提高大型语言模型的能力。该方法涉及使用来自较小的、特定领域的模型的数学上不正确的草稿来训练一个更大的模型,其性能优于标准的强化学习微调。该技术在MATH-500和分布外AIME 2025/2026基准测试中显示出显著的提升,为Mathstral-7B模型实现了新的最先进水平。
-
新框架VeryTrace验证和修复LLM推理痕迹
研究人员开发了VeryTrace,一个旨在验证和修复大型语言模型(LLM)生成的推理痕迹的新框架。该系统使用领域特定语言(DSL)将自然语言推理形式化为结构化、可编译的格式。DSL明确定义了步骤依赖关系,将定量数据视为可执行表达式,并构建了语义推理。VeryTrace结合了确定性检查和LLM审计,以查明和修复错误,在数学、机器人学和亲属关系推理等各种领域提高了准确性,而无需领域特定的训练。
-
新基准TriggerBench揭示LLM的前瞻性记忆挑战
研究人员推出TriggerBench,这是一个旨在评估大型语言模型(LLM)前瞻性记忆(PM)的新基准。与依赖显式查询的回顾性记忆(RM)不同,PM评估LLM在没有直接提示的情况下自发回忆和处理潜在约束的能力。该基准显示,虽然增强的推理能力可以改善主动回忆,但LLM可能会过度拟合简单的“始终提醒”启发式方法,并且在处理隐式约束或过载触发器时遇到困难。此外,PM比RM更具挑战性,随着上下文长度的增加,准确性急剧下降,这表明强大的前瞻性记…
-
新框架统一图像生成能力;研究解决蒸馏挑战
研究人员推出了一种新颖的 on-policy 生成场蒸馏框架 DanceOPD,旨在将文本到图像、局部编辑和全局编辑等多种图像生成能力统一到单个模型中。该框架解决了将这些能力结合起来可能导致性能下降的常见问题。DanceOPD 将样本路由到特定的能力场,并使用速度 MSE 目标进行训练,从而在保持整体生成质量的同时组合专家能力。此外,其他研究还探索了 on-policy 蒸馏技术,包括缓解输出多样性减少和解决长推理任务中的位置偏差的方…
-
新的TAPO方法通过显式纠错增强LLM推理能力
研究人员推出了一种名为轨迹增强策略优化(TAPO)的新方法,通过自蒸馏来增强大型语言模型(LLM)的推理能力。与隐式地将模型输出与目标分布对齐的传统方法不同,TAPO显式地构建了纠正性轨迹。这些轨迹保留了错误推理直到失败点,然后结合了来自正确参考样本的自然语言诊断和纠正后的推理。
-
新的TAPO方法通过显式纠错增强LLM自蒸馏 · 跟踪4个来源
研究人员推出了一种新方法,称为轨迹增强策略优化(TAPO),用于大型语言模型的自蒸馏。与隐式对齐分布的传统方法不同,TAPO显式地构建了纠正性轨迹。这些轨迹保留了错误推理直到失败点,然后纳入自然语言诊断和纠正后的推理。在AIME 2024、AIME 2025和HMMT 2025上的实验表明,与GRPO相比,TAPO提高了初始推理和纠错的有效性。
-
Ideogram 4.0 领衔开源图像模型发布;微软详解 MAI-Thinking-1
Ideogram 发布了其开源图像生成模型的 4.0 版本,该模型现被认为是同类产品中的最佳模型。此次发布以及 Reve 的进步,凸显了 AI 在处理图像布局和构图能力方面的显著进展。微软也发布了其 MAI-Thinking-1 模型,这是一项重大的技术发布,强调了从头开始训练而不进行蒸馏,并取得了高基准分数。
-
NVIDIA 量化 Alibaba 的 Qwen3.6-35B 模型以实现高效部署
NVIDIA 发布了 Alibaba 的 Qwen3.6-35B-A3B 模型的量化版本,命名为 nvidia/Qwen3.6-35B-A3B-NVFP4。该模型使用 NVFP4 数据类型,将内存需求减少约 3.06 倍,同时在各种基准测试中保持了有竞争力的性能。它针对 AI 代理系统、聊天机器人和 RAG 系统进行了优化部署,并已准备好商用。
-
新方法通过分析置信度动态来优化 LLM 推理
两篇新的研究论文提出通过分析大型语言模型(LLM)在推理过程中的置信度水平来优化其推理时间的方法。第一篇论文 EAGer 使用了 token 级熵来动态分配计算资源,仅在不确定性高时才分支到多个推理路径。第二篇论文置信度动态增益(CDG)观察到,正确的推理轨迹往往会随着时间的推移而提高置信度,而错误的轨迹则会下降,并利用这种动态来选择更好的答案。这两种方法在复杂推理基准测试中都显示出显著的性能提升和计算量减少。
-
新基准揭示大型语言模型推理失败及Claude的回避行为
研究人员开发了鲁棒推理基准(RRB),这是一个新的评估流程,用于测试大型语言模型在经过故意文本扰动的数学问题上的表现。该基准显示,虽然前沿模型在很大程度上具有弹性,但Anthropic的Claude模型会明确拒绝许多经过转换的提示。开放权重模型准确率显著下降,其中一些模型在各种失败模式下的准确率下降高达54%。研究还发现“查询内注意力稀释”是一个关键问题,即中间推理步骤会降低同一上下文窗口内后续问题的性能,这表明需要进行架构更改来管理注意力机制。
-
新方法增强了用于 LLM 训练的 on-policy distillation
研究人员开发了改进 on-policy distillation (OPD) 的新方法,OPD 是一种利用大型模型训练小型语言模型的技术。一种方法 TIP,通过分析学生熵和师生分歧来识别信息性 token,实现了显著的内存减少和性能提升。另一种方法 SimCT,通过扩展监督空间以包含多 token 续写来解决不同分词器的问题,恢复了丢失的信号并提高了推理和代码生成任务的性能。此外,EffOPD 通过优化更新轨迹和模块分配来加速 OPD…
-
NVIDIA Star Elastic 将多个推理模型嵌入单一检查点
NVIDIA 研究人员推出了一种新颖的训练后方法 Star Elastic,该方法将不同参数大小的多个推理模型嵌入到单一检查点中。这种方法无需额外的微调即可从较大的父模型中提取较小的、嵌套的子模型。Star Elastic 利用可训练的路由器和知识蒸馏来优化模型组件的选择,从而实现高效的资源利用和针对不同推理任务量身定制的模型性能。
-
新的RLVR方法通过正负提示配对增强LLM推理能力
研究人员开发了一种名为提示高效RLVR的新方法,可改进大型语言模型在推理任务上的训练。该技术侧重于选择同时提供积极锚点和来自罕见失败信号的提示,这与以往基于方差的方法不同。通过配对“难但可解”和“易但脆弱”的提示,并使用加权方法来放大成功和失败,该方法提高了样本效率,并在数学推理基准测试中取得了显著的性能提升。