研究人员开发了GUIDE(Geometric Unrolling Inside MLLM Early-layers),一个旨在增强多模态大语言模型(MLLMs)理解物理空间和3D场景的新框架。与先前在单点融合几何信息的做法不同,GUIDE将编码器的多层次几何特征渐进式地集成到MLLM的早期层中。这使得模型能够持续访问和整合不同粒度的几何线索,从而提高其处理空间推理任务的能力。该框架还包含一个双重上下文感知门控机制,用于调节几何信息流,防止冗余和干扰预训练表示。在VSI-Bench、ScanRefer和Scan2Cap等基准测试上的实验表明,GUIDE是有效的,其中5B和9B模型取得了强劲的性能。 AI
影响 该框架可以提高AI的空间推理能力,从而在机器人和3D场景理解领域实现更复杂的应用。
排序理由 该集群包含一篇详细介绍多模态LLM新框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →