PulseAugur
实时 05:59:00
English(EN) ArmorOCR: Grounded Adversarial Visual Perception via Observation-Transferred Self-Distillation

ArmorOCR框架通过新的AdvSpot基准增强了对抗性OCR感知能力

研究人员推出ArmorOCR,一个新颖的两阶段训练框架,旨在增强光学字符识别(OCR)在对抗性攻击下的鲁棒性。该框架通过提出AdvSpot来解决现有OCR基准的局限性,AdvSpot是第一个专门用于基于基础的对抗性OCR评估的基准,包含390张具有区域级标注的图像,涵盖各种对抗性OCR类型。ArmorOCR利用On-Policy Self-Distillation (OPSD) 从转换后的观测中获取对抗性OCR感知能力,并通过Group Relative Policy Optimization (GRPO) 来完善这种感知能力,在保持通用OCR性能的同时,展示了增强的对抗性OCR能力。 AI

影响 这项研究可能带来更鲁棒的OCR系统,能够抵御对抗性攻击,从而提高依赖文本识别的应用的安全性与可靠性。

排序理由 该集群包含一篇详细介绍对抗性OCR新方法和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

ArmorOCR框架通过新的AdvSpot基准增强了对抗性OCR感知能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Linhan Cao, Siyuan Li, Jun Lan, Liangbo He, Guannan Li, Xiaolei Huang, Jun Jia, Shuheng Zhou, Huijia Zhu, Weiqiang Wang, Wei Sun ·

    ArmorOCR:通过观察迁移的自蒸馏实现基于观察的对抗性视觉感知

    arXiv:2608.20122v1 Announce Type: new Abstract: Large multimodal models (LMMs) have demonstrated strong OCR recognition capabilities, yet remain vulnerable to adversarial visual text that is readable to humans but challenging for models to localize and recognize. Existing OCR ben…