研究人员开发了CARVE,一个新颖的框架,旨在提高基于切片的、多模态大型语言模型(MLLMs)对3D医学体积理解的效率。当前方法将3D体积表示为2D切片序列,导致大量的视觉标记(visual tokens)给LLM主干带来负担。CARVE通过在LLM推理前压缩视觉标记来解决这个问题,将标记缩减视为一个预算受限的分配问题。它沿着深度轴将体积划分为窗口,并根据跨切片证据非均匀地分配标记,在代表性切片上创建空间锚点,并从完整体积中检索局部证据。这种方法在保留高性能的同时移除了约80%的视觉标记,在医学VQA基准测试中优于现有的压缩基线。 AI
影响 这项研究可能导致LLM更有效地处理3D医学数据,从而改善诊断工具和研究能力。
排序理由 该集群包含一篇详细介绍提高AI模型效率新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →