Vision Language Navigation
PulseAugur coverage of Vision Language Navigation — every cluster mentioning Vision Language Navigation across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的VLN系统解决导航遗忘问题并利用大模型
两篇研究论文介绍了视觉语言导航(VLN)的新方法。VLN任务要求智能体根据指令在环境中导航。第一篇论文PGN利用盘古多模态大模型(OpenPangu-7B)进行离线动作预测,采用两阶段训练过程和专用硬件以提高效率。第二篇论文HiMemVLN通过引入分层记忆系统来解决开源VLN模型中的“导航遗忘”问题,以提高记忆和定位能力,显著提升了在模拟和真实世界场景中的性能。
-
新AI方法训练智能体预测未来视觉信息以实现更好的导航
研究人员开发了一种名为未来状态条件视觉语言导航(FSC-VLN)的新方法,以提高AI智能体在视觉导航任务中的性能。该方法训练AI预测未来的视觉结果,而不仅仅是学习下一个动作。通过在训练期间引入与未来视觉嵌入对齐的未来查询令牌,FSC-VLN在R2R val-unseen等基准测试中表现出更高的性能,尤其是在较长的导航任务中。
-
新的AdvNav攻击目标是视觉语言导航系统
研究人员开发了AdvNav,一个新颖的黑盒对抗性攻击框架,旨在破坏视觉语言导航(VLN)系统。与先前需要白盒访问或专注于单步任务的方法不同,AdvNav在没有模型梯度的情况下运行,并针对顺序感知-行动循环。它利用双粒度行为反馈机制,结合轨迹和动作级别的性能得分,来指导一个迭代发现破坏性噪声配置的优化策略。评估表明,AdvNav在R2R数据集上针对基于Transformer和基于LLM的VLN模型取得了很高的攻击成功率,突显了当前系统存…
-
新的FSD-VLN架构通过双系统方法增强了无人机导航
研究人员开发了FSD-VLN,一种用于空中视觉语言导航的新型双系统架构。该系统旨在通过将高级语义推理与低延迟飞行控制分离,来提高无人机(UAV)的自主导航能力。该架构包含一个用于语义理解的慢速流和一个使用Diffusion Transformer进行动作生成的快速流,显著提高了导航成功率并降低了模拟中的延迟。
-
World2Minecraft 和 Dream-Cubed 推进用于生成详细 Minecraft 环境的 AI 技术
研究人员开发了 World2Minecraft 系统,该系统通过预测 3D 语义占用率将真实世界场景转换为结构化的 Minecraft 环境。这使得在这些重建场景中进行视觉语言导航等下游任务成为可能。为了提高重建质量,创建了一个新的数据采集管道和大规模 MinecraftOcc 数据集,其中包含来自 156 个室内场景的超过 100,000 张图像。此外,一个名为 Dream-Cubed 的独立项目引入了一个大型 Minecraft …