一篇新的 arXiv 论文通过测试前沿多模态大语言模型(MLLMs)评估医学图像对齐的能力,来探索它们在通用视觉推理方面的能力。研究发现,尽管几个月前发布的模型表现不佳,GPT-6 在各种场景下准确率超过了 85%。特定任务的微调模型在训练过的任务上可以媲美或超越前沿模型,但在泛化到未见过的设置方面表现有限。这项研究表明,MLLMs 在视觉评估方面正接近一个可以整合到医学成像流程中的水平。 AI
影响 前沿 MLLMs 开始展现出对医学成像流程进行自动化质量控制的能力。
排序理由 该集群包含一篇详细介绍人工智能模型能力研究结果的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →