研究人员开发了一个新的具身多模态基础框架,用于移动操作任务。该系统集成了主动多视图语义3D高斯溅射与基于扩散的视觉-语言-动作策略。在真实机器人评估中,该框架实现了60%的长时序成功率,显著优于PointVLA(40%)和DexVLA(28%)等现有方法。该方法在杂乱环境、视角变化以及处理具身约束方面表现出更强的鲁棒性。 AI
影响 通过先进的3D场景理解,提高了机器人在复杂操作任务中的鲁棒性和成功率。
排序理由 这是一篇详细介绍机器人和计算机视觉领域新技术方法的学术论文。
- alphaXiv
- arXiv
- CatalyzeX
- CORE Recommender
- DagsHub
- DexVLA
- Gotit.pub
- Hugging Face
- Influence Flower
- PointVLA
- ScienceCast
- Semantic 3D Gaussian Splatting
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →