PulseAugur
实时 06:02:25
English(EN) MIRA-Ev:A Benchmark for Granular Evidence Detection and Relational Reasoning in Clinical Exams

新的MIRA-Ev基准评估临床NLP模型在证据推理方面的能力

研究人员推出MIRA-Ev,一个旨在评估临床自然语言处理(NLP)模型的新基准。与目前仅关注最终答案准确性的方法不同,MIRA-Ev评估模型如何利用临床文本中的证据。该基准建立在西班牙内科住院医师(MIR)执照考试案例的基础上,并包含前提、论点及其支持或攻击关系的详细注释。MIRA-Ev提供西班牙语、英语和巴斯克语版本,是首个巴斯克语临床论证资源。 AI

影响 该基准有望带来更强大的临床AI系统,使其能够更好地理解和利用患者病例中的证据。

排序理由 该集群描述了一个用于评估AI模型的新学术基准,发布在arXiv上。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的MIRA-Ev基准评估临床NLP模型在证据推理方面的能力

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Iker De la Iglesia, Johanna Ramirez-Romero, Jose Maria Villa-Gonzalez, Irune Urroz Garc\'ia, Ander Barrena, Aitziber Atutxa ·

    MIRA-Ev: 临床考试中细粒度证据检测和关系推理的基准

    arXiv:2607.19201v1 Announce Type: cross Abstract: Clinical NLP evaluation remains dominated by multiple-choice question answering (MCQA), which scores only final-answer accuracy and cannot detect when a model reaches the correct diagnosis while grounding it in irrelevant, absent,…