RxR-CE
PulseAugur coverage of RxR-CE — every cluster mentioning RxR-CE across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
VTInstructor框架为连续环境生成导航指令
研究人员开发了VTInstructor,一个用于在连续环境中生成导航指令的新颖框架。该系统解决了从密集RGB流中提取轨迹线索的挑战,而之前的方法依赖于离散的视点图。VTInstructor通过将轨迹压缩为关键帧、叠加路径和转弯信息,并将这些信号注入视觉编码器,将隐式轨迹几何转换为显式视觉提示。该框架在R2R-CE和RxR-CE基准测试上取得了新的最先进成果,显著提高了指令遵循的成功率,并为下游导航任务带来了收益。
-
TAMP-Nav 框架增强大型视觉语言模型(VLMs)的具身导航能力
研究人员推出 TAMP-Nav,一个旨在增强大型视觉语言模型(VLMs)具身导航能力的新框架。该方法将导航任务重新构建为二维视觉提示,使 VLMs 能够选择像素,然后将这些像素投影到三维坐标以执行。TAMP-Nav 还包含一个选择性推理机制,仅在关键节点触发思维链(Chain-of-Thought),并使用锚点轨迹记忆(Anchor-Trajectory Memory)来压缩冗余路径。该框架在 R2R-CE 等基准测试中取得了最先进的…
-
Robostral Navigate:可扩展的8B视觉语言模型在机器人导航领域创下新的SOTA · 跟踪2个来源
研究人员开发了Robostral Navigate,一个拥有80亿参数的视觉语言模型,专为可扩展的机器人导航而设计。该模型独特地处理单目RGB图像来预测航点,使其能够适应各种机器人形态,如轮式、腿式和空中平台,而无需重新校准。一种新颖的prefix-caching训练方法将训练时间从数月缩短到数天,并且该模型在R2R-CE和RxR-CE基准测试中取得了最先进的成果,性能优于依赖更复杂传感器设置的系统。
-
StereoNav框架提升AI代理的真实世界导航能力
研究人员推出了一种名为StereoNav的新框架,旨在提高视觉-语言导航(VLN)代理在真实环境中导航的可靠性。该系统通过引入目标位置先验以实现稳定引导,并利用立体视觉增强深度感知,来解决由感知不稳定和指令模糊引起的性能下降问题。实验表明,StereoNav在基准数据集上取得了最先进的成果,并在复杂、非结构化环境中展现出更强的导航可靠性,性能优于更大、数据密集型的模型。
-
Three-Step Nav 规划器改进了零样本视觉-语言导航代理
研究人员开发了一种名为 Three-Step Nav 的新分层规划器,以改进零样本视觉与语言导航 (VLN) 代理。该方法使用三视图协议来解决当前由 MLLM 驱动的 VLN 系统中常见的漂移和过早停止等问题。通过向前查看地标、当前查看子目标对齐、向后查看审核轨迹,Three-Step Nav 在无需额外训练的情况下提高了导航精度。