PulseAugur
实时 09:49:21
English(EN) Right Answer, Wrong Heat: Explanation-Aware Evaluation and Thermal-Grounded Feedback for MLLMs on Infrared Images

新框架评估多模态大语言模型在红外图像上的热度接地能力

开发了一个用于红外图像多模态大语言模型(MLLMs)的新评估框架,该框架超越了简单的答案准确性,以评估解释与热证据的接地情况。该框架利用双LLM共识裁判,揭示了即使是正确的答案也可能基于薄弱或可见光证据,并且在更强大的模型中,省略红外图像会削弱热度接地能力。研究人员还引入了热度接地反馈(TGF),一种无需训练的方法,可以在不改变所选答案的情况下修改解释并提高其热度接地能力,这表明MLLMs需要优先考虑热度接地的解释,以实现可靠的红外场景理解。 AI

影响 强调了对多模态大语言模型进行更鲁棒评估的必要性,尤其是在红外成像等专业领域,以确保输出的可靠性和可信度。

排序理由 学术论文,介绍了一种用于多模态大语言模型的新评估框架和方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新框架评估多模态大语言模型在红外图像上的热度接地能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Yongsong Huang, Xiaofeng Liu, Tomo Miyazaki, Yaohou Fan, Shinichiro Omachi ·

    答案正确,热度错误:面向红外图像多模态大语言模型的解释感知评估与热力学接地反馈

    arXiv:2608.09145v1 Announce Type: new Abstract: General-purpose multimodal large language models (MLLMs) are increasingly applied to infrared images, where they are commonly scored by answer accuracy alone. However, a correct answer does not ensure that the model's explanation is…