一项新的研究论文探讨了使用视觉语言模型(VLM)从业务文档中提取结构化数据所涉及的权衡。该研究在一个合成支票数据集上评估了包括 GPT-5 等商业产品和 Claude Sonnet 4.5 等开源模型在内的十一个系统。微调开源 VLM 可显著提高其性能,在某些情况下甚至超过商业系统,而 GPT-5 在整体准确性方面领先,Claude Sonnet 4.5 在日期提取方面则表现不佳。该研究还引入了一个框架,帮助从业者根据质量、延迟、治理和数量等因素选择最合适的方法。 AI
影响 为在文档提取中选择 VLM 提供了实用的指导,强调了性能和成本的权衡。
排序理由 该集群包含一篇研究论文,详细介绍了对特定任务的视觉语言模型的评估。[lever_c_demoted from research: ic=1 ai=1.0]
- alphaXiv
- arXiv
- CatalyzeX
- Claude Sonnet 4.5
- DagsHub
- Gotit.pub
- GPT-5
- Hugging Face
- optical character recognition
- regular expression
- ScienceCast
- vision-language model
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →