研究人员推出SD-MAR,一个旨在增强视觉语言模型(VLM)在多图像分析推理能力的新框架。该框架利用通过受控扰动生成的合成数据,为变化检测和定量比较等任务创建场景。通过采用一种名为GRPO-lite with Backward Discounted Allocation的强化学习方法,在SD-MAR上训练的模型在领域内准确性方面显示出显著的改进,其中Qwen2.5-VL-7B在基准测试中超越了GPT-4.1。至关重要的是,这些改进并未损害在其他已建立基准测试上的领域外泛化能力。 AI
影响 增强了VLM在复杂视觉推理任务中的能力,可能改进需要多图像分析的应用。
排序理由 该集群描述了一篇介绍视觉语言模型新框架和训练方法的研究论文。
- Backward Discounted Allocation
- GPT-4.1
- GRPO-lite
- InternVL3 8B
- MathVista
- MMBench
- MMMU PRO
- Qwen2.5-VL-7B
- vision-language model
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →