一项名为 DroneCATS 的新基准测试评估了多模态大语言模型(MLLMs)作为无人机控制代理的能力。研究发现,虽然较小的开源模型可以有效地导航,但它们在遵守动作协议和正确终止任务方面存在困难。前沿模型也表现出问题,尤其是在多无人机协调方面,它们可能无法区分不同的视角。研究强调了 MLLMs 的空间感知能力与其执行有纪律、以目标为导向的动作的能力之间的差距,尤其是在机载计算能力受限的情况下。 AI
影响 突出了当前 MLLMs 在具身人工智能任务中的关键差距,表明需要能够可靠地遵循协议并识别任务完成情况的模型。
排序理由 学术论文,介绍了一个新基准测试和对现有模型的评估。
在 Hugging Face Daily Papers 阅读 →
- Claude Opus-5
- Cosmos3-Edge-2B
- DroneCATS
- DroneCATS-Agent
- Gemini 3.7 Flash
- GPT-5
- Qwen 3.5
- arXiv
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →