PulseAugur
实时 10:11:37
English(EN) Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

新框架通过识别驱动决策的模态来审计多模态大语言模型

研究人员开发了一个名为反事实模态归因(CMA)的新框架,用于评估多模态大语言模型(MLLM)的预测主要由哪种模态(如图像或文本)负责。该方法解决了MLLM可能通过依赖错误证据产生正确输出来掩盖潜在的捷径学习或不安全推理的问题。CMA利用耦合的扩散先验生成反事实,并应用Shapley值量化模态级别的贡献,在受控测试中准确识别驱动决策的模态,并在真实临床数据上优于现有方法。 AI

影响 增强了多模态大语言模型的审计能力,通过揭示隐藏的推理失败,对安全关键型应用至关重要。

排序理由 该集群包含一篇详细介绍多模态大语言模型新框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架通过识别驱动决策的模态来审计多模态大语言模型

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Vahidin Hasic, Chao Wang, Luis C. Garcia-Peraza-Herrera, David Watson, Senka Krivic ·

    Which Modality Decides? Counterfactual Modality Attribution for Multimodal LLMs

    arXiv:2608.00076v1 Announce Type: new Abstract: Multimodal large language models (MLLMs) increasingly support high-stakes decision making by combining complementary information from images and text. While existing explainability methods identify influential image regions or text …