研究人员开发了 FRESHLATENT,这是一种新颖的通道感知潜在适配器,专为使用拆分式视觉语言模型(VLM)的资源受限无人机(UAV)设计。这种轻量级适配器解决了在无线通信约束下 VLM 感知中中间特征被破坏的问题。FRESHLATENT 通过训练一个编码器-解码器来适应无线损坏,同时保持主 VLM 冻结,显著提高了在不利条件下的 gIoU 和 cIoU 等性能指标。与更重的通信编解码器相比,该系统在编码器参数、延迟和能耗方面均有大幅降低,使其成为任务关键型无人机应用的实用解决方案。 AI
影响 在充满挑战的无线条件下运行的无人机,能够实现更鲁棒、更高效的 VLM 感知。
排序理由 这是一篇详细介绍资源受限环境中 VLM 感知的创新技术方法的学术论文。 [lever_c_demoted from research: ic=1 ai=1.0]
- encoder-decoder
- feature-JSCC
- FRESHLATENT
- Gioux
- NVIDIA Jetson AGX Xavier
- Qiū
- unmanned aerial vehicle
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →