研究人员评估了三种开源视觉语言模型(VLM)——InternVL、Qwen-VL 和 SmolVLM——从机器人自拍图像评估近邻风险的能力。虽然所有模型在未经微调的情况下表现接近基线,但 Qwen-VL 在结合了高级提示策略和 QLoRA 微调后,在危险情况下的召回率表现更优。研究还发现,准确的危险分类与更好的空间定位能力并不相关,这表明当前的 VLM 在细粒度近邻推理和空间感知方面存在局限性。 AI
影响 这项研究突显了当前 VLM 在现实世界机器人导航安全性方面的局限性,并指出了未来在空间推理和定位能力方面的发展方向。
排序理由 该集群包含一篇详细介绍视觉语言模型研究的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →