一篇新的arXiv论文研究了语言模型的测试时扩展(TTS)技术,该技术通过使用额外的推理计算来改进输出。研究发现,虽然扩展探索有效地提高了各种领域(如医学、法律、金融和创意写作)的候选输出质量,但利用阶段——选择最佳最终输出——是主要瓶颈。这是因为奖励模型与真实质量之间的相关性很低,使得选择近乎随机。跨候选的综合分析显示质量持续提高,但仍只恢复了约40%的潜在质量,这表明选择候选池中的内容,而不是生成更多候选,是限制因素。 AI
影响 确定了当前语言模型输出生成的一个关键限制,表明重点应从生成更多候选转移到改进选择机制。
排序理由 学术论文,详细介绍了关于语言模型扩展的研究结果。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- creative writing
- finance
- General Chathansum Mattu Novellakalum
- language model
- Law
- medicine
- test-time scaling
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →