研究人员推出了LoMeVQA,一个旨在评估多模态大语言模型(MLLMs)在医学领域的时间推理能力的新基准。该基准包含超过206,000个纵向视觉问答对,涵盖五个不同的任务,旨在弥补当前在模拟疾病进展和治疗反应评估的时间信息方面的不足。初步评估表明,现有的MLLMs在这些任务上表现不佳,凸显了对MedLong-8B等专业模型的需求,该模型在LoMeVQA基准上展现了最先进的性能。 AI
影响 该基准有望推动AI解读纵向医疗数据的能力取得进步,从而可能提高疾病监测和治疗效果。
排序理由 该项目描述了一个用于评估AI模型的新基准和数据集,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →