研究人员引入了一个名为时间因果驱动评估的新框架,用于分析不同信息源如何影响视觉语言模型(VLMs)的生成过程。该框架使用因果和时间指标来追踪视觉输入、问题文本和生成前缀在解码过程中不断演变的角色。使用 Qwen3-VL-8B-Instruct 和 InternVL2-8B 等模型的实验表明,模型从早期依赖问题和视觉引导转向越来越依赖生成的前缀。与观察基线相比,提出的因果驱动指标在减少恢复误差方面显示出显著的改进。 AI
影响 为理解和改进 VLM 生成过程提供了新的诊断工具。
排序理由 该集群包含一篇详细介绍视觉语言模型新评估框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- InternVL2-8B
- LLaVA-Video-178K
- Mavis
- MiraData
- Qwen3-VL-8B-Instruct
- ScienceCast
- Temporal Causal Drive Evaluation Framework
- VLMBias
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →