研究人员开发了 SpatialBlock-15k,这是一个旨在提高大型视觉语言模型 (LVLM) 空间智能的合成数据集。该数据集包含 15,000 个块堆叠问题,模拟了 3D 到 2D 的投影、视角转换和结构组合,并加入了颜色调制以增强推理能力。实验表明,在 SpatialBlock-15k 上训练的 LVLM 在现实世界的空间任务上表现出更好的性能和泛化能力,即使数据具有合成性质。 AI
影响 该数据集可能带来在 3D 环境理解方面有所改进的 LVLM,从而增强机器人和增强现实领域的应用。
排序理由 该集群包含一篇研究论文,详细介绍了用于改进 LVLM 空间智能的新合成数据集。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- LVLMs
- ScienceCast
- SpatialBlock
- SpatialBlock-15k
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →