研究人员引入了EndoCA,一个旨在评估内窥镜视觉问答(VQA)系统中答案一致性的新基准。该基准评估模型提供的复杂答案是否与从同一图像派生的原子答案一致。研究发现,虽然一些模型在复杂问题上取得了高准确率,但它们在相关原子问题和整体一致性方面的表现却显著较低。为了解决这个问题,开发了一种名为原子支持协调(ASR)的无训练机制,该机制使用模型生成的原子答案来修改复杂答案或指导选择性回答。 AI
影响 这项研究为VQA系统引入了一种新的评估方法,有望在医学影像分析领域带来更可靠、更一致的AI模型。
排序理由 介绍新基准和方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →