研究人员开发了一种从文档图像中提取键值对的新方法,无需依赖传统的OCR预处理。他们对一个名为SmolDocling的紧凑型2.56亿参数视觉语言模型进行了微调,以端到端地执行此任务,联合处理识别、定位和关联。据报道,这种方法在FUNSD和XFUND等基准测试上的表现优于大型零样本视觉语言模型,同时比Qwen2.5-VL等模型更小、更快。 AI
影响 这种方法可以简化文档处理流程,提高信息提取任务的效率。
排序理由 该集群包含一篇详细介绍文档图像分析新模型和方法的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →