研究人员开发了CAER,一个旨在解决多模态大语言模型(MLLMs)中文本声明与视觉证据之间冲突的新型框架。CAER采用跨度对齐的证据路由器来识别相关的视觉信息,并通过双前缀专家路由机制为视觉支持或矛盾的输入选择专门的专家。这种方法通过在不改变模型核心参数的情况下实现冲突感知的生成,从而提高了MLLMs的可靠性。在MMMC基准和新的AgriConflict数据集上的实验表明,CAER在检测和管理这些视觉-语言差异方面是有效的。 AI
影响 该框架可以通过更好地处理冲突信息来提高多模态人工智能系统的准确性和可信度。
排序理由 这是一篇详细介绍多模态大语言模型新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →