test-time scaling
PulseAugur coverage of test-time scaling — every cluster mentioning test-time scaling across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
New AI Method Enhances Plane Geometry Problem Solving
研究人员开发了一种名为多轨迹合成(MTS)的新方法,以提高AI模型在解决平面几何问题方面的性能。该方法通过生成多样化的推理轨迹并增强符号推导前的视觉基础,解决了现有方法的局限性。在多个基准测试上的实验表明,MTS在不同模型规模下始终提高了问题解决的准确性,并取得了与专用求解器相媲美的结果,同时还降低了计算成本。
-
LLMs通过测试时缩放改进科学方程发现
研究人员探索了用于科学方程发现的测试时缩放(TTS),这是一项开放式任务,语言模型通过数据反馈搜索方程。他们将LLM驱动的方程发现构建为一个迭代搜索过程,在一个计算分配框架下统一了各种方法。在LLM-SRBench数据集上的实验表明,搜索宽度是最关键的分配参数,随着计算预算的增加而改进,并通过并行化提高实际运行效率。研究结果表明,在有信息量验证器的情况下,控制探索和利用是扩展基于LLM的科学方程发现的关键。
-
语言模型测试时扩展瓶颈已在输出选择中识别
一篇新的arXiv论文研究了语言模型的测试时扩展(TTS)技术,该技术通过使用额外的推理计算来改进输出。研究发现,虽然扩展探索有效地提高了各种领域(如医学、法律、金融和创意写作)的候选输出质量,但利用阶段——选择最佳最终输出——是主要瓶颈。这是因为奖励模型与真实质量之间的相关性很低,使得选择近乎随机。跨候选的综合分析显示质量持续提高,但仍只恢复了约40%的潜在质量,这表明选择候选池中的内容,而不是生成更多候选,是限制因素。
-
新研究发现层剪枝损害大语言模型的长链推理能力
一篇新的arXiv论文揭示,层剪枝(一种优化大语言模型LLM的常用技术)会严重损害其执行长链推理的能力。虽然剪枝可能不影响一般知识任务,但它会严重降低在复杂推理基准上的性能,即使只移除少数几层也是如此。标准的微调方法不足以恢复这种丢失的推理能力,这表明需要新的剪枝策略来优先保留测试时扩展性和推理鲁棒性。
-
新的 GAIA 系统训练批评模型以提高 GUI 代理性能
研究人员开发了 GAIA,一个数据飞轮系统,旨在通过训练直观批评模型 (ICM) 来提高 GUI 代理的性能。该 ICM 评估代理操作的正确性,选择成功概率更高的操作。然后,系统使用此批评模型收集精炼数据,进而训练出更强大的批评模型,形成一个自我改进的循环。实验表明,这种迭代过程提高了各种 GUI 代理的测试时性能。
-
新研究质疑AI模型的过度采样
一篇新研究论文探讨了语言模型和推理系统中的测试时缩放概念,认为过度采样会导致性能下降。该论文引入了“模态上限”和“相关性上限”来描述额外采样收益递减或产生负面结果的点。它表明,这些系统的瓶颈在于识别正确答案,而不是生成答案,并且对于大多数任务来说,几十次采样就足够了。
-
综述论文梳理多模态AI模型的测试时缩放
一篇新的综述论文详细介绍了多模态基础模型(MFM)中新兴的测试时缩放(TTS)领域。该论文将现有的TTS方法分为基于采样、基于反馈和基于搜索的方法。它还概述了增强MFM在生成和推理任务中性能的常见应用、基准和未来研究方向。
-
随机回溯提升语言模型推理效率
研究人员开发了一种名为随机回溯的新方法,以提高语言模型在测试时扩展的效率。该技术允许模型重新访问先前生成的状体,而不是仅仅扩展当前解决方案的前沿。通过采用子池选择和结合序列蒙特卡洛方法的增强回溯,该方法旨在提高准确性,同时减少推理过程中生成的总令牌数。在数学推理基准上的实验表明,与现有方法相比,每令牌的准确性有所提高。
-
新框架使大型语言模型能够在推理过程中共享见解
研究人员推出了一种新颖的、无需训练的协作并行思维(CPT)框架,旨在提高大型语言模型测试时扩展(TTS)的效率。CPT通过实现不同分支之间的搜索时信息共享,解决了并行TTS方法中冗余探索的问题。这使得各分支能够重用他人已有的发现,而不是重新发现相同的信息,从而在HMMT和AIME等基准测试中改善了准确性-延迟权衡。