研究人员发现视觉语言模型(VLMs)中存在一种隐藏的不稳定性,而标准的输出级评估无法捕捉到这一点。一个新的评估框架衡量内部嵌入漂移、光谱敏感性和结构平滑度,揭示了模型在保持正确答案的同时,其内部表征可能发生显著变化。研究发现,尽管更大规模的模型准确率更高,但它们对扰动的敏感性相似甚至更高,并且不同任务受这些扰动的影响方式也不同。 AI
影响 凸显了当前视觉语言模型评估方法的潜在漏洞,表明需要更强大的测试来确保AI系统的可靠性。
排序理由 研究论文发布在arXiv上,详细介绍了一种新的视觉语言模型评估框架。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Farooq Ahmad Wani
- Hugging Face
- Multimodal Multitask Multimedia Understanding
- POPE
- SEEDBench
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →