研究人员推出了OpenMedQ,一个在包含约335万个样本的大型开放医学影像和文本领域数据集上预训练的医学视觉-语言模型。该模型在PathVQA和VQA-MED等基准测试中取得了最先进的成果,显著优于Med-PaLM M等规模更大的模型。此外,其视觉编码器在未见过(unseen)的分类任务上表现强劲,超越了其他医学视觉模型。该项目还发布了代码和演示以供社区复现。另外,OpenMedReason项目开发了一个大规模、开放的多模态医学推理语料库,包含约45万个来自科学文章的图像-问题-答案实例。该语料库以及OpenMedReason-Bench基准测试旨在提升医学视觉-语言模型超越简单准确性的推理能力,侧重于感知、医学知识和推理过程。使用OpenMedReason进行训练显示,VQA准确率平均提高了20%,并增强了推理轨迹的质量。 AI
影响 医学视觉-语言模型和推理数据集的这些进展可能会加速AI在临床诊断和研究中的应用。
排序理由 在arXiv上发布了两篇不同的研究论文,详细介绍了新的医学视觉-语言模型和数据集。
- Negin Baghbanzadeh
- OpenMedReason
- arXiv
- BiomedCLIP
- Hugging Face
- Med-PaLM M
- OpenMedQ
- OpenMedReason-Bench
- PathVQA
- PMC-CLIP
- PubMedCLIP
- VQA-MED
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →