研究人员引入了一个名为“测试时感知缩放”(TTSP)的新框架,以解决多模态大型语言模型(MLLM)中的“基础性悖论”。当MLLM在细粒度推理方面遇到困难时,就会出现这种悖论,因为它们需要识别正确的图像区域来关注,而这种识别需要对它们正在寻找的细节的先验知识。TTSP旨在通过将感知视为一个可扩展的推理单元来解决这个问题,使用熵门控探索来采样不同的推理路径,并使用证据账本来指导迭代改进和关键区域的重新检查。该框架在处理高分辨率和通用多模态基准测试时,表现出比现有的测试时缩放方法持续的性能改进,同时还提高了基础质量和令牌效率。 AI
影响 解决了多模态LLM的一个基本限制,有可能提高它们在图像方面的推理能力。
排序理由 详细介绍多模态LLM新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →