PulseAugur
实时 07:11:09
English(EN) SMSP: A Plug-and-Play Strategy of Multi-Scale Perception for MLLMs to Perceive Visual Illusions

新的SMSP框架增强了多模态大语言模型对视觉错觉的感知能力

研究人员开发了一个名为多尺度感知策略(SMSP)的新框架,以解决多模态大语言模型(MLLMs)在面对视觉错觉时的脆弱性。这些模型常常难以处理人类一眼就能看穿但它们却无法察觉的隐藏图案的图像,这归因于高频注意力偏差。SMSP作为一种即插即用的解决方案,通过抑制分散注意力的信号,模仿人类视觉感知,从而提高了MLLMs检测隐藏图案的能力。实验表明,在各种MLLMs上性能显著提升,其中一个模型的准确率在错觉图像上的表现从13.0%提高到84.0%。 AI

影响 增强了MLLMs在视觉错觉方面的鲁棒性,有望提高在现实世界应用中的安全性和可靠性。

排序理由 学术论文,详细介绍了一种改进MLLM视觉感知的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的SMSP框架增强了多模态大语言模型对视觉错觉的感知能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Jinzhe Tu, Ruilei Guo, Zihan Guo, Junxiao Yang, Shiyao Cui, Minlie Huang ·

    SMSP:一种即插即用的多尺度感知策略,用于多模态大模型感知视觉错觉

    arXiv:2603.23118v2 Announce Type: replace Abstract: Recent works have shown that multimodal large language models (MLLMs) are highly vulnerable to hidden-pattern visual illusions, where the hidden content is imperceptible to models but obvious to humans. This deficiency highlight…