PulseAugur
实时 07:27:44
English(EN) One Patch Is Enough: Reinforcement-Optimized Visual Token Grounding for MLLM-Based Scene Text Spotting

新的SPaTS框架提高了MLLM场景文本识别的准确性

研究人员开发了一个名为单补丁文本识别(SPaTS)的新框架,以提高多模态大语言模型(MLLM)的场景文本识别准确性。SPaTS为每个文本实例使用单个锚点视觉令牌,并通过一种称为单补丁选择性优化(SPaSO)的强化学习方法优化其选择。该框架还结合了方向嵌入对齐(DEA)和补丁增强解码(PED)来增强表示鲁棒性和定位精度。实验表明,SPaTS的性能优于现有的闭源MLLM和OCR MLLM。 AI

影响 这项研究可能带来更准确、更高效的多模态人工智能系统场景文本识别能力。

排序理由 该集群包含一篇详细介绍多模态大语言模型新框架的研究论文。[lever_c_research降级:ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的SPaTS框架提高了MLLM场景文本识别的准确性

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Rui Tang, Wentao Yang, Peirong Zhang, Yongxin Shi, Shun Zhang, Huiguo He, Lianwen Jin ·

    一个Patch就够了:基于MLLM的场景文本识别的强化优化视觉Token对齐

    arXiv:2607.27902v1 Announce Type: new Abstract: Scene text spotting requires high-precision alignment between textual recognition and spatial localization. While visual-token grounding has emerged as a promising formulation for Multimodal Large Language Models (MLLMs), the previo…