PulseAugur
实时 10:26:41
English(EN) Test-Time Scaling in the Wild: Why Exploitation, Not Exploration, Is the Bottleneck

语言模型测试时扩展瓶颈已在输出选择中识别

一篇新的arXiv论文研究了语言模型的测试时扩展(TTS)技术,该技术通过使用额外的推理计算来改进输出。研究发现,虽然扩展探索有效地提高了各种领域(如医学、法律、金融和创意写作)的候选输出质量,但利用阶段——选择最佳最终输出——是主要瓶颈。这是因为奖励模型与真实质量之间的相关性很低,使得选择近乎随机。跨候选的综合分析显示质量持续提高,但仍只恢复了约40%的潜在质量,这表明选择候选池中的内容,而不是生成更多候选,是限制因素。 AI

影响 确定了当前语言模型输出生成的一个关键限制,表明重点应从生成更多候选转移到改进选择机制。

排序理由 学术论文,详细介绍了关于语言模型扩展的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

语言模型测试时扩展瓶颈已在输出选择中识别

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Davide Romano, Kanak Raj, Jerrod Parker, Daniele Giofr\`e ·

    实测时在野外扩展:为何瓶颈在于利用而非探索

    arXiv:2608.18931v1 Announce Type: cross Abstract: Test-time scaling (TTS) improves language model outputs by spending additional inference compute - generating multiple candidates, searching over partial sequences, or iteratively refining drafts. These techniques yield large gain…