PulseAugur
实时 07:01:02
English(EN) Identify, Locate, Link: End-to-End Key-Value Extraction from Document Images

新型视觉语言模型无需OCR即可提取文档数据,性能超越大型模型

研究人员开发了一种从文档图像中提取键值对的新方法,无需依赖传统的OCR预处理。他们对一个名为SmolDocling的紧凑型2.56亿参数视觉语言模型进行了微调,以端到端地执行此任务,联合处理识别、定位和关联。据报道,这种方法在FUNSD和XFUND等基准测试上的表现优于大型零样本视觉语言模型,同时比Qwen2.5-VL等模型更小、更快。 AI

影响 这种方法可以简化文档处理流程,提高信息提取任务的效率。

排序理由 该集群包含一篇详细介绍文档图像分析新模型和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新型视觉语言模型无需OCR即可提取文档数据,性能超越大型模型

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · A. Said Gurbuz (IBM Research Zurich, ETH Zurich), Ahmed Nassar (IBM Research Zurich), Christoph Auer (IBM Research Zurich), Maksym Lysak (IBM Research Zurich), Lucas Morin (IBM Research Zurich), Matteo Omenetti (IBM Research Zurich), Tim Strohmeyer (IBM … ·

    识别、定位、关联:文档图像中的端到端键值提取

    arXiv:2608.20868v1 Announce Type: cross Abstract: Document processing pipelines traditionally cascade optical character recognition (OCR) engines with downstream models for structured information extraction, leading to multi-stage error propagation. We fine-tune SmolDocling, a co…