PulseAugur
实时 10:58:56

CARVE框架增强了LLM对3D医学体积的理解能力

研究人员开发了CARVE,一个新颖的框架,旨在提高基于切片的、多模态大型语言模型(MLLMs)对3D医学体积理解的效率。当前方法将3D体积表示为2D切片序列,导致大量的视觉标记(visual tokens)给LLM主干带来负担。CARVE通过在LLM推理前压缩视觉标记来解决这个问题,将标记缩减视为一个预算受限的分配问题。它沿着深度轴将体积划分为窗口,并根据跨切片证据非均匀地分配标记,在代表性切片上创建空间锚点,并从完整体积中检索局部证据。这种方法在保留高性能的同时移除了约80%的视觉标记,在医学VQA基准测试中优于现有的压缩基线。 AI

影响 这项研究可能导致LLM更有效地处理3D医学数据,从而改善诊断工具和研究能力。

排序理由 该集群包含一篇详细介绍提高AI模型效率新方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

CARVE框架增强了LLM对3D医学体积的理解能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zhenyu Yi, Qiang Hu, Zhenhao Li, Jiaxuan Zhao, Yusong Sun, Lichi Zhang ·

    CARVE:跨切片各向异性重新分配视觉证据以实现高效三维医学体积理解

    arXiv:2608.04515v1 Announce Type: cross Abstract: Slice-based MLLMs leverage mature 2D encoders by representing 3D volumes as sequences of 2D slices. However, this slice-wise formulation produces thousands of visual tokens that burden the LLM backbone, many of which capture overl…