研究人员开发了一种新颖的分类引导框架,用于大型视觉语言模型(LVLM),以改进从复杂文档中提取视觉信息的能力。该方法将文档类型分类与内容提取分离,并使用动态提示工程进行上下文学习,以实现跨不同布局的高效零样本推理。在投标数据集上进行测试,使用Qwen2.5-VL-7B的零样本方法显著优于有监督基线,F1分数提高了18.35个百分点,归一化编辑距离提高了0.23。进一步的微调增强了性能,证明了该框架对印章和水印等常见文档损坏具有鲁棒性。 AI
影响 该框架为复杂的文档理解提供了更高效、可扩展的解决方案,有望加速办公自动化。
排序理由 该集群包含一篇详细介绍新模型框架及其评估的学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →