开发了一个用于红外图像多模态大语言模型(MLLMs)的新评估框架,该框架超越了简单的答案准确性,以评估解释与热证据的接地情况。该框架利用双LLM共识裁判,揭示了即使是正确的答案也可能基于薄弱或可见光证据,并且在更强大的模型中,省略红外图像会削弱热度接地能力。研究人员还引入了热度接地反馈(TGF),一种无需训练的方法,可以在不改变所选答案的情况下修改解释并提高其热度接地能力,这表明MLLMs需要优先考虑热度接地的解释,以实现可靠的红外场景理解。 AI
影响 强调了对多模态大语言模型进行更鲁棒评估的必要性,尤其是在红外成像等专业领域,以确保输出的可靠性和可信度。
排序理由 学术论文,介绍了一种用于多模态大语言模型的新评估框架和方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Dual-LLM Consensus Judge
- Infrared images of the transiting disk in the epsilon Aurigae system
- MLLMs
- Thermal-Grounded Feedback
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →