研究人员开发了 APIVIS,这是一个旨在增强大型语言模型数学推理能力的新颖框架。该系统将有限预算的 Gumbel 搜索与可验证奖励(RLVR)的强化学习相结合,以增加训练展开的多样性。APIVIS 结合了直接响应和搜索响应,确保搜索过程中发现的改进能够积极影响模型的策略。该框架还纳入了选择性监督,以便在组奖励变得均匀时维持学习信号,否则这会阻碍 GRPO 算法。在既定的数学推理基准上的实验表明,APIVIS 的性能显著优于现有的基于搜索的方法。 AI
影响 增强了 LLM 在数学推理方面的能力,有可能提高在复杂问题解决任务中的性能。
排序理由 该集群描述了一篇关于改进 LLM 数学推理的新颖框架的最新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- APIVIS
- arXiv
- GRPO
- Gumbel search
- Hugging Face
- large-language models
- Reinforcement learning with verifiable rewards
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →