研究人员开发了BUZZY,一种新颖的解码方法,旨在减轻多模态选择题问答(MCQA)中的文本诱导偏差。这种无需训练的方法通过减去仅文本分布来纠正多模态预测,假设当模型的(多模态)分布与仅文本预测显著不同时,模型会依赖视觉证据。在五个基准和五个视觉-语言模型上的实验表明,与现有的对比解码方法相比,BUZZY的准确性更高,同时推理延迟降低了28%以上。 AI
影响 该方法可以提高视觉-语言模型在问答任务中的准确性和效率。
排序理由 该集群描述了一篇研究论文,其中详细介绍了一种用于多模态问答的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →