研究人员推出XEmbodied,一个旨在通过整合几何和物理线索来增强视觉-语言-动作(VLA)模型的新型基础模型。与目前在2D图像-文本数据上训练的现有模型不同,XEmbodied通过结构化的3D适配器和高效图像-具身适配器整合了3D几何感知和物理信号。这种方法旨在弥合通用VLM能力与复杂具身环境的特定需求之间的差距,从而提高在空间推理、交通语义和具身问答相关基准上的性能。 AI
影响 通过3D几何感知增强VLA模型,提高在复杂具身环境和具身问答中的性能。
排序理由 该集群描述了一篇新的研究论文,详细介绍了一个具有增强的几何和物理线索的具身环境基础模型。[lever_c_demoted from research: ic=1 ai=1.0]
- 3D Adapter
- arXiv
- Efficient Image-Embodied Adapter
- Hugging Face
- Kangan Qian
- Vision-Language-Action (VLA) models
- Vision--Language Models
- XEmbodied
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →