PulseAugur
实时 09:11:18
English(EN) OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

新的医学AI模型OpenMedQ和OpenMedReason推进视觉-语言能力

研究人员推出了OpenMedQ,一个在包含约335万个样本的大型开放医学影像和文本领域数据集上预训练的医学视觉-语言模型。该模型在PathVQA和VQA-MED等基准测试中取得了最先进的成果,显著优于Med-PaLM M等规模更大的模型。此外,其视觉编码器在未见过(unseen)的分类任务上表现强劲,超越了其他医学视觉模型。该项目还发布了代码和演示以供社区复现。另外,OpenMedReason项目开发了一个大规模、开放的多模态医学推理语料库,包含约45万个来自科学文章的图像-问题-答案实例。该语料库以及OpenMedReason-Bench基准测试旨在提升医学视觉-语言模型超越简单准确性的推理能力,侧重于感知、医学知识和推理过程。使用OpenMedReason进行训练显示,VQA准确率平均提高了20%,并增强了推理轨迹的质量。 AI

影响 医学视觉-语言模型和推理数据集的这些进展可能会加速AI在临床诊断和研究中的应用。

排序理由 在arXiv上发布了两篇不同的研究论文,详细介绍了新的医学视觉-语言模型和数据集。

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →

新的医学AI模型OpenMedQ和OpenMedReason推进视觉-语言能力

报道来源 [4]

  1. arXiv cs.AI TIER_1 English(EN) · Ibrahim Gulluk, Max Van Puyvelde, Olivier Gevaert ·

    OpenMedQ:面向医学视觉语言模型的广泛开放预训练

    arXiv:2606.12953v1 Announce Type: new Abstract: We present OpenMedQ, a medical vision-language model pretrained on the broadest fully-open medical mix to date: 14 datasets totaling ~3.35M pretraining samples spanning pathology, radiology, microscopy, and text-only clinical QA. Op…

  2. arXiv cs.AI TIER_1 English(EN) · Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci, Abeer Badawi, Adibvafa Fallahpour, Arash Afkanpour, Leonid Sigal, Ali Etemad, Elham Dolatabadi ·

    OpenMedReason:医学视觉语言模型的科学推理监督

    arXiv:2606.12169v1 Announce Type: cross Abstract: High-stakes clinical use of large vision-language models (LVLMs) requires reasoning that is grounded in visual evidence and clinical knowledge, not just correct final answers. We introduce OpenMedReason, a large-scale, open multim…

  3. arXiv cs.AI TIER_1 English(EN) · Elham Dolatabadi ·

    OpenMedReason:医学视觉语言模型的科学推理监督

    High-stakes clinical use of large vision-language models (LVLMs) requires reasoning that is grounded in visual evidence and clinical knowledge, not just correct final answers. We introduce OpenMedReason, a large-scale, open multimodal medical reasoning corpus comprising approxima…

  4. arXiv cs.CV TIER_1 English(EN) · Olivier Gevaert ·

    OpenMedQ:面向医疗视觉语言模型的广泛开放预训练

    We present OpenMedQ, a medical vision-language model pretrained on the broadest fully-open medical mix to date: 14 datasets totaling ~3.35M pretraining samples spanning pathology, radiology, microscopy, and text-only clinical QA. OpenMedQ reaches state-of-the-art BLEU-1 on PathVQ…