研究人员开发了新的方法 vCT 和 vCCT 来评估视觉语言模型 (VLM) 中思维链 (CoT) 推理的忠实度。这些方法将现有的反事实技术应用于视觉输入,从而能够评估 CoT 在多大程度上可靠地反映了基于视觉证据的决策过程。对八个开源 VLM 的基准测试显示,CoT 经常未能准确追踪视觉元素对预测的影响,有时会遗漏关键对象或过度强调次要对象。 AI
影响 引入了新的评估技术,以了解视觉语言模型中推理的可靠性。
排序理由 该集群包含一篇详细介绍新研究方法和发现的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Correlational Counterfactual Test
- Counter-A-OKVQA
- Counterfactual Test
- Counter-SNLI-VE
- Hugging Face
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →