LayoutLMv3
PulseAugur coverage of LayoutLMv3 — every cluster mentioning LayoutLMv3 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
DocAnnot框架利用LVLM加速KIE数据集创建
一个名为DocAnnot的新框架已被开发出来,用于加速关键信息提取(KIE)数据集的创建。DocAnnot利用大型视觉语言模型(LVLM)提取标签值,并结合OCR进行文本和边界框检测。一种新颖的空间感知上下文匹配(SICM)算法通过考虑空间关系和邻近性以及文本数据来增强标签-值关联。虽然仅在DocAnnot自动生成的数据上训练的模型取得了不错的性能,但人工标注数据仍然更优,尽管DocAnnot显著减少了人工工作量和成本。
-
研究比较多模态模型用于文档分类
一篇新研究论文分析了用于分类视觉丰富文档的多模态方法,比较了基于Transformer和LLM的架构。该研究在RVL-CDIP基准上评估了LayoutLMv3、Donut、Qwen3-VL-32B-Instruct和Qwen3-32B。结果表明,专门的多模态Transformer对于具有复杂布局的文档更优越,图像信息是分类最关键的因素。
-
PDF RAG 管道因布局失败;布局感知分块是解决方案
检索增强生成 (RAG) 管道在处理 PDF 文档时常常失败,原因是简单的文本分割方法忽略了文档的布局。这会导致包含连接的列、错位的页脚和分离的标题的损坏的块,从而导致信息检索不准确。解决方案涉及一个四层方法:检测文本块的正确阅读顺序,按语义角色(例如文本、表格、图形)对块进行分类,删除重复的标题和页脚,并按文档结构(章节)而不是任意的 token 数量进行分块。与标准方法相比,这种布局感知分块显著提高了检索准确性,即使使用相同的嵌入模型。