PulseAugur
实时 04:02:02
English(EN) Visual Information Extraction from Documents via Classification-Guided Large Vision-Language Models

新的LVLM框架通过最小化监督提升文档信息提取能力

研究人员开发了一种新颖的分类引导框架,用于大型视觉语言模型(LVLM),以改进从复杂文档中提取视觉信息的能力。该方法将文档类型分类与内容提取分离,并使用动态提示工程进行上下文学习,以实现跨不同布局的高效零样本推理。在投标数据集上进行测试,使用Qwen2.5-VL-7B的零样本方法显著优于有监督基线,F1分数提高了18.35个百分点,归一化编辑距离提高了0.23。进一步的微调增强了性能,证明了该框架对印章和水印等常见文档损坏具有鲁棒性。 AI

影响 该框架为复杂的文档理解提供了更高效、可扩展的解决方案,有望加速办公自动化。

排序理由 该集群包含一篇详细介绍新模型框架及其评估的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的LVLM框架通过最小化监督提升文档信息提取能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Huafu Li, Guo Chen, Jia Xia, Lei Wang, Wei Du, Yun Yao, Weijun Peng, Liming Li ·

    通过分类引导的大型视觉语言模型从文档中提取视觉信息

    arXiv:2607.22723v1 Announce Type: new Abstract: Visual information extraction (VIE) from visually rich documents remains challenging due to high layout variability and real-world impairments. Existing methods typically rely on sequential OCR pipelines or end-to-end models requiri…