研究人员开发了一个名为多尺度感知策略(SMSP)的新框架,以解决多模态大语言模型(MLLMs)在面对视觉错觉时的脆弱性。这些模型常常难以处理人类一眼就能看穿但它们却无法察觉的隐藏图案的图像,这归因于高频注意力偏差。SMSP作为一种即插即用的解决方案,通过抑制分散注意力的信号,模仿人类视觉感知,从而提高了MLLMs检测隐藏图案的能力。实验表明,在各种MLLMs上性能显著提升,其中一个模型的准确率在错觉图像上的表现从13.0%提高到84.0%。 AI
影响 增强了MLLMs在视觉错觉方面的鲁棒性,有望提高在现实世界应用中的安全性和可靠性。
排序理由 学术论文,详细介绍了一种改进MLLM视觉感知的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Hugging Face
- IlluChar
- Jinzhe Tu
- MLLMs
- Qwen3-VL-8B-Instruct
- Société des missionnaires de Saint Paul
- Strategy of Multi-Scale Perception
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →