研究人员开发了一种新方法,可以在保持大型语言模型(LLM)多样性的同时增强其推理能力。该方法称为具有可验证奖励的强化学习(RLVR),使用更小、更弱的语言模型生成部分推理轨迹。这些轨迹充当提示,促使目标LLM探索更广泛的不同推理路径,并防止过度自信。该技术在数学基准测试中显示出持续的改进,尤其是在k值较大时,且无需额外的监督微调或复杂的奖励设计。 AI
影响 在无需复杂微调的情况下增强LLM的推理和多样性,有望提高复杂任务的性能。
排序理由 详细介绍LLM训练新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →