研究人员开发了 VisionFoundry,这是一个自动化管道,利用大型语言模型(LLM)和文本到图像模型来生成用于训练视觉语言模型(VLM)的合成视觉感知数据。这个名为 VisionFoundry-10k 的合成数据集在空间理解和视角识别等感知基准测试中,持续提高了 VLM 的性能,甚至优于在自然图像上训练的模型。该方法具有可扩展性和有效性,证明了合成监督可以显著增强 VLM 的能力。 AI
影响 这项研究提出了一种提高 VLM 感知能力的、可扩展的方法,可能减少对大型、手动标注数据集的依赖。
排序理由 该集群包含两篇 arXiv 论文,详细介绍了用于生成合成数据以提高 AI 模型性能的新颖方法。
- arXiv
- CV-Bench-3D
- Guanyu Zhou
- MMVP-pair
- Qwen2.5-VL-3B-Instruct
- Saptarshi Neil Sinha
- VisionFoundry
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →