研究人员开发了SonarLLM,这是一种新颖的多模态大语言模型,专为水下感知而设计。与主要依赖光学数据的现有模型不同,SonarLLM原生处理声纳输入,使其能够根据不断变化的环境条件自适应地利用声纳和光学数据。该模型与用于评估水下感知任务的基准数据集SonarBench一同推出。在测试中,SonarLLM的性能显著优于基线模型,在识别、计数、视觉问答和字幕生成等任务中表现出色,尤其是在充满挑战的浑浊水下环境中。 AI
影响 这项研究通过改善在挑战性条件下的感知能力,有望为水下探索和机器人技术带来更强大的AI系统。
排序理由 该集群包含一篇详细介绍新模型和基准的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →