PulseAugur
EN
LIVE 09:10:14

New Medical AI Models OpenMedQ and OpenMedReason Advance Vision-Language Capabilities

Researchers have introduced OpenMedQ, a medical vision-language model pretrained on a large, open dataset of approximately 3.35 million samples across various medical imaging and text domains. This model achieves state-of-the-art results on benchmarks like PathVQA and VQA-MED, outperforming significantly larger models such as Med-PaLM M. Additionally, its vision encoder demonstrates strong performance on unseen classification tasks, surpassing other medical vision models. The project also released code and a demo for community reproducibility. Separately, the OpenMedReason project has developed a large-scale, open multimodal medical reasoning corpus of around 450,000 image-question-answer instances derived from scientific articles. This corpus, along with the OpenMedReason-Bench benchmark, aims to improve the reasoning capabilities of medical vision-language models beyond simple accuracy, focusing on perception, medical knowledge, and rationale. Training with OpenMedReason has shown a 20% average improvement in VQA accuracy and enhanced reasoning trace quality. AI

IMPACT These advancements in medical vision-language models and reasoning datasets could accelerate AI adoption in clinical diagnostics and research.

RANK_REASON Two distinct research papers released on arXiv detailing new medical vision-language models and datasets.

Read on arXiv cs.AI →

AI-generated summary · Google Gemini · from 4 sources. How we write summaries →

New Medical AI Models OpenMedQ and OpenMedReason Advance Vision-Language Capabilities

COVERAGE [4]

  1. arXiv cs.AI TIER_1 English(EN) · Ibrahim Gulluk, Max Van Puyvelde, Olivier Gevaert ·

    OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

    arXiv:2606.12953v1 Announce Type: new Abstract: We present OpenMedQ, a medical vision-language model pretrained on the broadest fully-open medical mix to date: 14 datasets totaling ~3.35M pretraining samples spanning pathology, radiology, microscopy, and text-only clinical QA. Op…

  2. arXiv cs.AI TIER_1 English(EN) · Negin Baghbanzadeh, Pritam Sarkar, Michael Colacci, Abeer Badawi, Adibvafa Fallahpour, Arash Afkanpour, Leonid Sigal, Ali Etemad, Elham Dolatabadi ·

    OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

    arXiv:2606.12169v1 Announce Type: cross Abstract: High-stakes clinical use of large vision-language models (LVLMs) requires reasoning that is grounded in visual evidence and clinical knowledge, not just correct final answers. We introduce OpenMedReason, a large-scale, open multim…

  3. arXiv cs.AI TIER_1 English(EN) · Elham Dolatabadi ·

    OpenMedReason: Scientific Reasoning Supervision for Medical Vision-Language Models

    High-stakes clinical use of large vision-language models (LVLMs) requires reasoning that is grounded in visual evidence and clinical knowledge, not just correct final answers. We introduce OpenMedReason, a large-scale, open multimodal medical reasoning corpus comprising approxima…

  4. arXiv cs.CV TIER_1 English(EN) · Olivier Gevaert ·

    OpenMedQ: Broad Open Pretraining for Medical Vision-Language Models

    We present OpenMedQ, a medical vision-language model pretrained on the broadest fully-open medical mix to date: 14 datasets totaling ~3.35M pretraining samples spanning pathology, radiology, microscopy, and text-only clinical QA. OpenMedQ reaches state-of-the-art BLEU-1 on PathVQ…