test-time scaling
PulseAugur coverage of test-time scaling — every cluster mentioning test-time scaling across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
新研究发现层剪枝损害大语言模型的长链推理能力
一篇新的arXiv论文揭示,层剪枝(一种优化大语言模型LLM的常用技术)会严重损害其执行长链推理的能力。虽然剪枝可能不影响一般知识任务,但它会严重降低在复杂推理基准上的性能,即使只移除少数几层也是如此。标准的微调方法不足以恢复这种丢失的推理能力,这表明需要新的剪枝策略来优先保留测试时扩展性和推理鲁棒性。
-
新的 GAIA 系统训练批评模型以提高 GUI 代理性能
研究人员开发了 GAIA,一个数据飞轮系统,旨在通过训练直观批评模型 (ICM) 来提高 GUI 代理的性能。该 ICM 评估代理操作的正确性,选择成功概率更高的操作。然后,系统使用此批评模型收集精炼数据,进而训练出更强大的批评模型,形成一个自我改进的循环。实验表明,这种迭代过程提高了各种 GUI 代理的测试时性能。
-
新研究质疑AI模型的过度采样
一篇新研究论文探讨了语言模型和推理系统中的测试时缩放概念,认为过度采样会导致性能下降。该论文引入了“模态上限”和“相关性上限”来描述额外采样收益递减或产生负面结果的点。它表明,这些系统的瓶颈在于识别正确答案,而不是生成答案,并且对于大多数任务来说,几十次采样就足够了。
-
综述论文梳理多模态AI模型的测试时缩放
一篇新的综述论文详细介绍了多模态基础模型(MFM)中新兴的测试时缩放(TTS)领域。该论文将现有的TTS方法分为基于采样、基于反馈和基于搜索的方法。它还概述了增强MFM在生成和推理任务中性能的常见应用、基准和未来研究方向。
-
随机回溯提升语言模型推理效率
研究人员开发了一种名为随机回溯的新方法,以提高语言模型在测试时扩展的效率。该技术允许模型重新访问先前生成的状体,而不是仅仅扩展当前解决方案的前沿。通过采用子池选择和结合序列蒙特卡洛方法的增强回溯,该方法旨在提高准确性,同时减少推理过程中生成的总令牌数。在数学推理基准上的实验表明,与现有方法相比,每令牌的准确性有所提高。
-
新框架使大型语言模型能够在推理过程中共享见解
研究人员推出了一种新颖的、无需训练的协作并行思维(CPT)框架,旨在提高大型语言模型测试时扩展(TTS)的效率。CPT通过实现不同分支之间的搜索时信息共享,解决了并行TTS方法中冗余探索的问题。这使得各分支能够重用他人已有的发现,而不是重新发现相同的信息,从而在HMMT和AIME等基准测试中改善了准确性-延迟权衡。