PulseAugur
实时 09:48:10
English(EN) BRUCE: Benchmarking Robustness Under Corruption Escalation for Scientific Vision-Language Reasoning

新的BRUCE框架对图像腐蚀下的VLM鲁棒性进行基准测试

研究人员引入了BRUCE,一个旨在评估视觉语言模型(VLM)在面对损坏或失真的输入图像时的鲁棒性的新框架。与主要关注干净任务准确性的现有方法不同,BRUCE量化了VLM的推理性能随着视觉腐蚀严重程度增加而下降的速度。该框架利用了新的指标——鲁棒性腐蚀指数(RCI)和遍历-RCI(T-RCI)——来衡量在各种科学推理任务中的这种恶化,包括依赖OCR的、空间和符号推理。 AI

影响 该框架通过突出VLM在现实的、降级的输入条件下的故障模式,可能带来更可靠的视觉语言模型。

排序理由 该集群描述了一篇介绍用于评估AI模型鲁棒性的新型基准测试框架的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的BRUCE框架对图像腐蚀下的VLM鲁棒性进行基准测试

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Saim Rehman, Muhammad Shafique ·

    BRUCE:科学视觉-语言推理的腐蚀升级鲁棒性基准测试

    arXiv:2608.07742v1 Announce Type: new Abstract: Visual-language models (VLMs) frequently struggle with robustness issues in real-world situations due to low- or varying-quality input images. In this paper, we aim at analyzing VLMs' robustness by applying perturbations and distort…