研究人员推出 TAMP-Nav,一个旨在增强大型视觉语言模型(VLMs)具身导航能力的新框架。该方法将导航任务重新构建为二维视觉提示,使 VLMs 能够选择像素,然后将这些像素投影到三维坐标以执行。TAMP-Nav 还包含一个选择性推理机制,仅在关键节点触发思维链(Chain-of-Thought),并使用锚点轨迹记忆(Anchor-Trajectory Memory)来压缩冗余路径。该框架在 R2R-CE 等基准测试中取得了最先进的性能,效率很高,所需的训练轨迹显著减少,并减少了思维链的调用。 AI
影响 增强了 VLMs 在具身导航方面的能力,有望改进机器人和自主系统。
排序理由 该条目描述了一篇详细介绍新型具身导航框架的新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- Anchor-Trajectory Memory
- Embodied-Navigator
- Group Relative Policy Optimization
- Large Vision Language Models
- Pixel-to-3D Action Formulation
- R2R-CE
- RxR-CE
- Space-Time Indicators
- TAMP-Nav
- Two-Level Alignment Paradigm
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →