PulseAugur
实时 10:47:46
English(EN) Can Vision-Language Models Assess Proxemic Risk from Egocentric Robot Images?

视觉语言模型用于机器人导航安全测试

研究人员评估了三种开源视觉语言模型(VLM)——InternVLQwen-VLSmolVLM——从机器人自拍图像评估近邻风险的能力。虽然所有模型在未经微调的情况下表现接近基线,但 Qwen-VL 在结合了高级提示策略和 QLoRA 微调后,在危险情况下的召回率表现更优。研究还发现,准确的危险分类与更好的空间定位能力并不相关,这表明当前的 VLM 在细粒度近邻推理和空间感知方面存在局限性。 AI

影响 这项研究突显了当前 VLM 在现实世界机器人导航安全性方面的局限性,并指出了未来在空间推理和定位能力方面的发展方向。

排序理由 该集群包含一篇详细介绍视觉语言模型研究的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

视觉语言模型用于机器人导航安全测试

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Vladyslava Rudas, Dmytro Kuzmenko ·

    视觉-语言模型能否评估以自我为中心的机器人图像中的空间距离风险?

    arXiv:2608.12515v1 Announce Type: new Abstract: Assessing proxemic danger from a robot's egocentric perspective is critical for safe embodied navigation in human environments and requires both visual and contextual reasoning. We evaluate three opensource vision-language models (V…