研究人员推出ArmorOCR,一个新颖的两阶段训练框架,旨在增强光学字符识别(OCR)在对抗性攻击下的鲁棒性。该框架通过提出AdvSpot来解决现有OCR基准的局限性,AdvSpot是第一个专门用于基于基础的对抗性OCR评估的基准,包含390张具有区域级标注的图像,涵盖各种对抗性OCR类型。ArmorOCR利用On-Policy Self-Distillation (OPSD) 从转换后的观测中获取对抗性OCR感知能力,并通过Group Relative Policy Optimization (GRPO) 来完善这种感知能力,在保持通用OCR性能的同时,展示了增强的对抗性OCR能力。 AI
影响 这项研究可能带来更鲁棒的OCR系统,能够抵御对抗性攻击,从而提高依赖文本识别的应用的安全性与可靠性。
排序理由 该集群包含一篇详细介绍对抗性OCR新方法和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
- AdvSpot
- ArmorOCR
- arXiv
- Group Relative Policy Optimization
- Large Multimodal Models
- On-Policy Self-Distillation
- optical character recognition
- visual question answering
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →