PulseAugur
实时 11:49:58
English(EN) How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

新的基准测试 SciFigBench 旨在通过误导性科学图表测试 VLM 的可靠性

一项名为 SciFigBench 的新基准测试已被开发出来,用于评估视觉语言模型(VLM)在面对不完整或误导性科学图表时的行为可靠性。该基准测试评估感知、推理和行为方面,包含来自 250 张图表的 34,000 多个评估设置。还引入了容纳-抵抗-推断(A-R-I)框架,用于衡量模型在承认不确定性、抵抗误导性信息和谨慎推断方面的能力。结果表明,尽管 GPT-5.2 在描述质量和推理方面表现出色,但它经常出现幻觉,而 Gemini 3.1 Pro 则表现出更大的不确定性承认和对误导性数据的抵抗力。 AI

影响 强调了 VLM 需要展现超越单纯准确性的行为可靠性,这对于科学应用至关重要。

排序理由 该集群包含一篇介绍新颖的 AI 模型评估基准和框架的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的基准测试 SciFigBench 旨在通过误导性科学图表测试 VLM 的可靠性

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao ·

    视觉语言模型(VLMs)在失明或被误导时会如何表现?对VLMs科学图表行为的评估

    arXiv:2608.13267v1 Announce Type: cross Abstract: Existing vision-language model (VLM) benchmarks emphasize perception and reasoning accuracy (how well VLMs describe and reason about what they see in an image), with limited attention to behavioral reliability under uncertainty (h…