一篇新研究论文探讨了真实世界文档中光学化学结构识别(OCSR)的挑战,强调了合成数据和实际专利及期刊图表之间的性能差距。该研究使用合成数据和真实世界数据的混合体对包括Qwen2.5-VL-7B、InternVL3-8B和GLM-4.1V-9B在内的多种视觉语言模型(VLM)进行了微调。结果表明,纳入标记的真实训练图像对于提高准确性至关重要,最佳配置在一个基准测试上实现了0.84的精确匹配。研究还发现,视觉塔适应策略(如LoRA)的有效性因所使用的基础VLM而异。 AI
影响 强调了多样化、真实世界的训练数据对于提高AI模型在化学结构识别等专业任务上的性能的重要性。
排序理由 研究论文,详细介绍了模型性能和训练数据对特定任务的影响。[lever_c_demoted from research: ic=1 ai=1.0]
- CLEF-IP
- GLM-4.1V-9B
- Hugging Face
- InternVL3 8B
- Qwen2.5-VL-7B
- United Overseas Bank
- United States Patent and Trademark Office
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →