PulseAugur
实时 10:14:14

新框架GUIDE通过渐进式几何集成增强MLLMs

研究人员开发了GUIDE(Geometric Unrolling Inside MLLM Early-layers),一个旨在增强多模态大语言模型(MLLMs)理解物理空间和3D场景的新框架。与先前在单点融合几何信息的做法不同,GUIDE将编码器的多层次几何特征渐进式地集成到MLLM的早期层中。这使得模型能够持续访问和整合不同粒度的几何线索,从而提高其处理空间推理任务的能力。该框架还包含一个双重上下文感知门控机制,用于调节几何信息流,防止冗余和干扰预训练表示。在VSI-Bench、ScanRefer和Scan2Cap等基准测试上的实验表明,GUIDE是有效的,其中5B和9B模型取得了强劲的性能。 AI

影响 该框架可以提高AI的空间推理能力,从而在机器人和3D场景理解领域实现更复杂的应用。

排序理由 该集群包含一篇详细介绍多模态LLM新框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架GUIDE通过渐进式几何集成增强MLLMs

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Chongyu Wang, Ting Huang, Chunyu Sun, Xinyu Ning, Di Wang, Hao Tang ·

    让几何学引导:多模态大模型中几何先验的层级展开

    arXiv:2604.05695v2 Announce Type: replace Abstract: Multimodal Large Language Models (MLLMs) have achieved remarkable progress in 2D visual tasks but still struggle to understand physical space in real-world visual streams. Recently, feed-forward geometric foundation models that …