PulseAugur
实时 11:40:43
English(EN) MME-VideoOCR: Evaluating OCR-Based Capabilities of Multimodal LLMs in Video Scenarios

新基准揭示多模态大语言模型在视频OCR方面存在困难

引入了一个名为MME-VideoOCR的新基准,用于评估多模态大语言模型(MLLMs)在视频内容中的光学字符识别(OCR)能力。该基准强调,由于运动模糊和时间变化,当前MLLMs在视频OCR方面存在困难,即使是表现最佳的模型Gemini 2.5 Pro,准确率也仅为73.7%。研究表明,MLLMs在需要单帧文本识别的任务上表现更好,但在需要整体视频理解、时空推理或跨帧信息集成时则表现不佳。 AI

影响 突出了当前多模态大语言模型在视频OCR方面的局限性,为未来模型开发和训练指明了方向。

排序理由 该集群包含一篇介绍用于评估多模态大语言模型的新基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新基准揭示多模态大语言模型在视频OCR方面存在困难

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Yang Shi, Huanqian Wang, Wulin Xie, Huanyao Zhang, Lijie Zhao, Yi-Fan Zhang, Xinfeng Li, Chaoyou Fu, Zhuoer Wen, Wenting Liu, Zhuoran Zhang, Xinlong Chen, Bohan Zeng, Sihan Yang, Yushuo Guan, Zhang Zhang, Liang Wang, Haoxuan Li, Zhouchen Lin, Yuanxing Zh… ·

    MME-VideoOCR:评估多模态大模型在视频场景下的OCR能力

    arXiv:2505.21333v3 Announce Type: replace Abstract: Multimodal Large Language Models (MLLMs) have achieved considerable accuracy in Optical Character Recognition (OCR) from static images. However, their efficacy in video OCR is significantly diminished due to factors such as moti…