研究人员开发了一个探索式提示脚手架框架,以增强多模态大型语言模型中的强化学习。该方法通过使用探索潜力得分(EPS)来识别和重写信息量较少的提示,从而动态调整训练提示的分布。通过将教师监督重新定义为数据精炼而非模仿,该方法在Geo3K、MMK12、MathVision和MMMU-Pro等各种基准测试中显示出显著的性能提升。 AI
影响 通过优化提示效用和提高基准性能,增强了多模态LLM的强化学习。
排序理由 该集群描述了一篇详细介绍用于改进多模态LLM训练的新颖框架的研究论文。
- Exploration-Guided Prompt Scaffolding
- Exploration Potential Score
- Geo3K
- Grpo
- KL-regularized policy improvement theory
- MathVision
- MMK12
- MMMU PRO
- Multimodal Reinforcement Post-Training
- arXiv
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →