arXiv 上发表的一项新研究探讨了使用轻量级、开源的视觉语言模型 (VLM) 进行文档 OCR 和结构化 JSON 提取。该研究比较了八个参数高达 70 亿的 VLM,评估了它们在零样本、少样本和微调设置下的性能。研究结果表明,与手动转录或商业系统相比,这些较小的 VLM 可以提供一种可持续、私密且高性能的替代方案,为遗产机构提供指导。 AI
影响 为遗产机构在使用受控、高效的 VLM 进行文档数字化和数据提取方面提供指导。
排序理由 arXiv 上发表的研究论文,详细介绍了 VLM 在文档处理方面的比较研究。[lever_c_demoted from research: ic=1 ai=1.0]
- Approximate Normalized Levenshtein Similarity
- arXiv
- Character Error Rate
- JSON
- mAP-F1
- mean Average Precision F1
- optical character recognition
- vision-language model
- Vision--Language Models
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →