PulseAugur
实时 10:58:43
English(EN) EndoVLM: An Endoscopy Vision-Language Pre-training Model via Anatomy-Guided Sparsity and Progressive Alignment

EndoVLM:新型视觉语言模型增强内窥镜图像分析

研究人员开发了EndoVLM,这是一种新颖的视觉语言基础模型,专门用于分析内窥镜图像。该模型利用了超过348,000次内窥镜检查,将临床报告与相应的图像集配对。EndoVLM采用了解剖引导稀疏池化机制,根据文本描述有效地聚合相关帧,并采用渐进式语义感知对齐策略来弥合视觉数据和临床数据之间的差距。实验表明,EndoVLM的表现优于现有的基础模型,并可与特定任务的方法相媲美,在更广泛的临床应用中展现出强大的零样本泛化能力。 AI

影响 该模型通过更好地整合视觉和文本临床数据,有望显著提高内窥镜检查的诊断准确性和效率。

排序理由 该集群描述了一篇详细介绍特定领域新模型的创新研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

EndoVLM:新型视觉语言模型增强内窥镜图像分析

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Zhenyu Yi, Jianwei Xu, Yue Hu, Zhongwei Qiu, Sijing Li, Liang Huang, Bin Lv, Ling Zhang, Yingda Xia ·

    EndoVLM:一种通过解剖学引导的稀疏性和渐进式对齐的内窥镜视觉-语言预训练模型

    arXiv:2608.04472v1 Announce Type: cross Abstract: The development of foundation models (FMs) is crucial for advancing endoscopic image analysis. However, existing endoscopy FMs mainly rely on self-supervised learning from uni-modal images or videos, overlooking the rich semantic …