PulseAugur
实时 13:12:13
English(EN) PubMed-Ophtha: An open resource for training ophthalmology vision-language models on scientific literature

新的AI模型和数据集推动了眼科和外科手术中视觉语言能力的发展

研究人员推出了PubMed-Ophtha,这是一个包含从科学文献中提取的超过10万对眼科图像-字幕的新数据集。该数据集旨在解决医学领域训练视觉语言模型高质量数据稀缺的问题。提取过程包括对PDF中的图进行详细分解、对成像模态进行标注以及复杂的基于LLM的字幕分割,在检测和提取任务中实现了高精度。 AI

影响 提供了一个大规模、标注过的数据集,以加速眼科领域专业视觉语言模型的发展。

排序理由 该集群描述了为研究目的发布的新数据集和相关模型。

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 5 个来源。 我们如何撰写摘要 →

新的AI模型和数据集推动了眼科和外科手术中视觉语言能力的发展

报道来源 [5]

  1. arXiv cs.CV TIER_1 English(EN) · Abdelrahman Zaian, Sheethal Bhat, Mohamed Abdalkader, Andreas Maier ·

    Retina-RAG:用于联合视网膜诊断和临床报告生成的检索增强视觉语言模型

    arXiv:2605.06173v1 Announce Type: new Abstract: Diabetic Retinopathy (DR) is a leading cause of preventable blindness among working-age adults worldwide, yet most automated screening systems are limited to image-level classification and lack clinically structured reporting. We pr…

  2. arXiv cs.CV TIER_1 English(EN) · Andreas Maier ·

    Retina-RAG:用于联合视网膜诊断和临床报告生成的检索增强视觉语言模型

    Diabetic Retinopathy (DR) is a leading cause of preventable blindness among working-age adults worldwide, yet most automated screening systems are limited to image-level classification and lack clinically structured reporting. We propose Retina-RAG, a low-cost modular framework t…

  3. arXiv cs.CV TIER_1 English(EN) · Verena Jasmin Hallitschke, Carsten Eickhoff, Philipp Berens ·

    PubMed-Ophtha:一个用于在科学文献上训练眼科视觉-语言模型的开放资源

    arXiv:2605.02720v1 Announce Type: new Abstract: Vision-language models hold considerable promise for ophthalmology, but their development depends on large-scale, high-quality image-text datasets that remain scarce. We present PubMed-Ophtha, a hierarchical dataset of 102,023 ophth…

  4. arXiv cs.CV TIER_1 English(EN) · Chengan Che, Chao Wang, Jiayuan Huang, Xinyue Chen, Luis C. Garcia-Peraza-Herrera ·

    LLM 生成的文本能否赋能手术视觉-语言预训练?

    arXiv:2604.18134v2 Announce Type: replace Abstract: Recent advancements in self-supervised learning have led to powerful surgical vision encoders capable of spatiotemporal understanding. However, extending these visual foundations to multi-modal reasoning tasks is severely bottle…

  5. arXiv cs.CV TIER_1 English(EN) · Philipp Berens ·

    PubMed-Ophtha:一个用于在科学文献上训练眼科视觉-语言模型的开放资源

    Vision-language models hold considerable promise for ophthalmology, but their development depends on large-scale, high-quality image-text datasets that remain scarce. We present PubMed-Ophtha, a hierarchical dataset of 102,023 ophthalmological image-caption pairs extracted from 1…