olympiad
PulseAugur coverage of olympiad — every cluster mentioning olympiad across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
SpecScale 系统通过高效的推测执行增强 LLM 推理能力
一个名为 SpecScale 的新系统已被开发出来,以提高大型语言模型 (LLM) 服务效率,特别是在需要数学和编码等复杂推理的任务中。推测执行(simultaneously explores multiple reasoning paths)会带来挑战,例如候选路径过多和频繁的验证需求。SpecScale 通过早期修剪低质量路径、去重计算和延迟详细验证等技术解决了这些问题。在 MATH 和 Olympiad 等基准测试上的评估表明,…
-
新的DART框架通过自适应思考预算优化AI推理
研究人员开发了DART,一种新颖的无训练混合推理模型框架。DART通过自适应地将查询路由到直接回答或扩展思考过程来优化token使用。该系统通过采样两个低成本草稿并进行比较来实现这一点;一致则直接回答,不一致则根据草稿熵触发预算预测。这种方法在不要求标记数据或梯度更新的情况下,在各种模型规模和家族中保持或提高了准确性,同时显著减少了token消耗,显示出前景。
-
使用多求解器分歧奖励训练的AI推理系统表现出改进的性能
研究人员开发了一种新颖的AI推理系统训练方法,通过利用多个模型之间的分歧来生成具有挑战性的问题。这种方法称为多求解器分歧奖励,与之前依赖单一模型不确定性的方法形成对比,后者可能导致学习信号崩溃。通过采用具有不同能力和采样温度的集成模型,该系统可以识别出求解器产生冲突答案的问题,从而创建更有效的课程。在Qwen3-4B模型上的实验表明,在竞赛数学基准测试上有了显著的改进,这表明该技术在开发更强大的AI推理能力方面具有潜力。
-
StudyBench基准测试揭示AI从教科书中学习的困境
一项名为StudyBench的新基准测试旨在衡量AI自我进化方法的效率,特别是它们从物理教科书中学习并将知识应用于解决复杂问题的能力。该基准测试揭示了指导和计算方面的显著差距,表明当前方法难以将教科书知识转化为奥赛水平的解题能力。即使是最有效的方法,其能力也仅达到人类从相同材料中获得能力的一小部分,这凸显了对更有效的自我进化技术进行进一步研究的必要性。
-
DART框架在无需训练的情况下优化AI推理,减少了token使用量
研究人员开发了DART,一个新颖的、无需训练的框架,用于优化混合AI模型的推理能力。DART能够自适应地路由查询,允许直接回答简单问题,同时为复杂问题分配更多的计算预算。该方法使用草稿协议来确定是否需要扩展思考,显著减少了token使用量,同时在具有挑战性的数学和代码推理任务上保持或提高了准确性。该框架的有效性已在各种模型规模和系列中得到证明,无需标记数据或梯度更新。
-
INFUSER框架通过引导式自我进化提升LLM推理能力
研究人员开发了INFUSER,一个用于自我进化语言模型的新框架,可增强推理能力。该迭代式协同训练系统包含一个生成器(Generator),用于从文档中生成问题和答案,以及一个从中学习的求解器(Solver)。生成器根据影响分数(influence score)获得奖励,确保它生成真正能提升求解器性能的问题,而非仅仅是难题。INFUSER展示了显著的改进,一个8B模型在数学和编码任务上的表现优于一个更大的32B模型。