两篇研究论文介绍了视觉语言导航(VLN)的新方法。VLN任务要求智能体根据指令在环境中导航。第一篇论文PGN利用盘古多模态大模型(OpenPangu-7B)进行离线动作预测,采用两阶段训练过程和专用硬件以提高效率。第二篇论文HiMemVLN通过引入分层记忆系统来解决开源VLN模型中的“导航遗忘”问题,以提高记忆和定位能力,显著提升了在模拟和真实世界场景中的性能。 AI
影响 VLN领域的这些进步可能为各种应用带来更可靠、更具成本效益的具身智能体。
排序理由 两篇在arXiv上发表的学术论文,详细介绍了视觉语言导航的新方法。
- alphaXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- HiMemVLN
- Hugging Face
- Navigation Amnesia
- OpenPangu-7B
- Pangu Multimodal Foundation Model
- PGN
- ScienceCast
- Vision-Language Navigation
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →