AIME2025
PulseAugur coverage of AIME2025 — every cluster mentioning AIME2025 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
AI代理Intern-S1-MO攻克奥赛级别数学难题
研究人员开发了Intern-S1-MO,这是一种新颖的长时域推理代理,旨在解决奥赛级别的复杂数学问题。该代理采用多轮、分层推理方法,使用相互连接的大型推理模型(LRM)系统进行推理、摘要和验证。通过维护一个紧凑的引理记忆,Intern-S1-MO可以在多个阶段探索广泛的推理空间,克服了标准LRM的上下文长度限制。该系统使用一种新的强化学习框架OREAL-H进行训练,该框架同时增强了LRM的推理能力和代理的整体性能。实验表明,Inter…
-
新方法将大语言模型评估失败与定向数据修复联系起来
研究人员开发了一种新颖的方法,以弥合大语言模型在能力评估与数据整理之间的差距。他们的方法被称为“能力切片”,通过根据共享特征(如任务类型和输出约束)对评估样本进行分组,从而能够精确地定位模型的弱点。这使得一个闭环系统得以实现,其中基准测试的失败可以系统地追溯到具体的数据干预,从而超越直观的修复,实现可审计的实验验证。
-
新的VISTA框架增强了LLM提示优化
研究人员开发了VISTA,一个用于自动优化大型语言模型提示的新框架。该方法旨在克服现有反思性提示优化技术的局限性,这些技术可能不透明并导致性能下降。VISTA将假设生成与提示重写分离,从而实现更具可解释性的优化跟踪,并提高在算术应用题等复杂任务上的准确性。
-
PiCSAR 方法通过概率置信度评分提升 LLM 推理链的准确性
研究人员推出了一种名为 PiCSAR 的新方法,用于提高大型语言和推理模型的准确性。这种无需训练的方法通过从多个生成选项中选择最佳候选解决方案来增强推理任务的性能。PiCSAR 利用推理过程和最终答案的联合对数似然来评估置信度,在 MATH500 和 AIME2025 等基准测试中取得了显著的提升。