PulseAugur
EN
LIVE 13:19:07

Vision-Language Models Tested for Robustness, Causal Reasoning, and Visual Search

Researchers are investigating the robustness and reasoning capabilities of vision-language models (VLMs) across several dimensions. One study introduces OCR-Robust, a benchmark to evaluate VLMs' resilience to visual perturbations in optical character recognition tasks, revealing that structural elements like charts and tables are particularly fragile. Another paper probes VLMs' struggles with causal order reasoning, finding they perform poorly despite excelling at object recognition, likely due to a lack of explicit causal expressions in training data. Additionally, a study examines how VLMs perform visual search tasks, comparing their "reasoning token" usage to human reaction times and noting both similarities and divergences in their search strategies. AI

IMPACT These studies highlight key limitations in current vision-language models, particularly in robustness to visual corruption, causal reasoning, and human-like visual search, guiding future research and development.

RANK_REASON Cluster consists of multiple academic papers published on arXiv, detailing research into vision-language models.

Read on Hugging Face Daily Papers →

AI-generated summary · Google Gemini · from 6 sources. How we write summaries →

Vision-Language Models Tested for Robustness, Causal Reasoning, and Visual Search

COVERAGE [6]

  1. arXiv cs.CL TIER_1 English(EN) · Yuxing Cheng, Yuan Wu, Yi Chang ·

    How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

    arXiv:2606.26041v1 Announce Type: cross Abstract: Vision-language models (VLMs) have achieved strong performance on OCR-based benchmarks and increasingly focused on text-rich understanding, but their robustness under controlled visual degradation remains insufficiently understood…

  2. arXiv cs.CL TIER_1 English(EN) · Yi Chang ·

    How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

    Vision-language models (VLMs) have achieved strong performance on OCR-based benchmarks and increasingly focused on text-rich understanding, but their robustness under controlled visual degradation remains insufficiently understood. This gap is critical for OCR reasoning, where vi…

  3. Hugging Face Daily Papers TIER_1 English(EN) ·

    How Robust is OCR-Reasoning? Evaluating OCR-Reasoning Robustness of Vision-Language Models under Visual Perturbations

    Vision-language models (VLMs) have achieved strong performance on OCR-based benchmarks and increasingly focused on text-rich understanding, but their robustness under controlled visual degradation remains insufficiently understood. This gap is critical for OCR reasoning, where vi…

  4. arXiv cs.AI TIER_1 English(EN) · Harshvardhan Saini, Samyak Jha, Yiming Tang, Dianbo Liu ·

    When Language Overwrites Vision: Over-Alignment and Geometric Debiasing in Vision-Language Models

    arXiv:2605.08245v4 Announce Type: replace-cross Abstract: Vision-Language Models (VLMs) increasingly power high-stakes applications, from medical imaging to autonomous systems, yet they routinely hallucinate, confidently describing content not present in the input. We investigate…

  5. arXiv cs.CL TIER_1 English(EN) · Zhaotian Weng, Haoxuan Li, Xin Eric Wang, Kuan-Hao Huang, Jieyu Zhao ·

    What's Missing in Vision-Language Models? Probing Their Struggles with Causal Order Reasoning

    arXiv:2506.00869v3 Announce Type: replace Abstract: Despite the impressive performance of vision-language models (VLMs) on downstream tasks, their ability to understand and reason about causal relationships in visual inputs remains unclear. Robust causal reasoning is fundamental …

  6. arXiv cs.CV TIER_1 English(EN) · Farahnaz Wick ·

    Do vision-language models search like humans? Reasoning tokens as a reaction-time analog in classic visual-search paradigms

    arXiv:2606.25066v1 Announce Type: cross Abstract: Visual search has been one of the most productive paradigms in the study of visual attention: the way reaction time scales with the number of items distinguishes parallel, "pop-out" search from serial, attention-demanding search. …