研究人员开发了一个名为“通过强化学习进行自我验证”(SVRL)的新型强化学习框架,以提高多模态推理代理的可靠性。该框架训练代理在其自身的推理过程中验证和过滤检索到的证据,从而减少对外部验证器的需求。SVRL还包含一个面向搜索的惩罚项,以最大限度地减少不必要的工具调用,并对生成多样化、格式良好的搜索查询给予奖励。当仅使用5000个视觉问答示例应用于Qwen-2.5-VL-7B模型时,SVRL在多跳VQA泛化和工具效率方面表现出持续的改进,缩小了与大型专有模型的性能差距,同时降低了成本。 AI
影响 该框架有望带来更高效、更可靠的多模态人工智能代理,可能降低计算成本并提高复杂推理任务的性能。
排序理由 该集群包含一篇详细介绍新研究框架及其在特定模型上应用的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Grpo
- Hugging Face
- Qwen-2.5-VL-7B
- Self-Verification via Reinforcement Learning
- visual question answering
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →