研究人员开发了一种名为分步边际信息增益(MIG)的新方法,以提高大型语言模型(LLM)和视觉语言模型(VLM)的推理能力。MIG 根据推理过程的每一步如何增加正确答案的可能性来计算内在奖励,提供比传统稀疏二元奖励更精细的反馈机制。该方法在各种基准测试中均显示出显著的改进,其性能优于仅基于结果的奖励,甚至在某些视觉语言任务中超越了外部过程奖励模型(PRM),而无需额外的推理时间处理。 AI
影响 这种新的内在奖励方法可以更有效地训练 LLM 和 VLM,在无需大量手动标注的情况下提高它们的推理能力。
排序理由 该集群描述了一种在学术论文中发布的新方法,用于改进 LLM 推理能力。[lever_c_demoted from research: ic=1 ai=1.0]
- GRPO
- large language models
- MathVerse
- PRM-BoN
- Process reward models
- Stepwise Marginal Information Gain
- vision-language models
- Xiangwei Wang
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →