实体
pdfplumber
pdfplumber
PulseAugur coverage of pdfplumber — every cluster mentioning pdfplumber across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
PDF解析质量是RAG系统的隐藏瓶颈
PDF解析的质量对检索增强生成(RAG)系统的性能有显著影响,常常成为一个隐藏的瓶颈。糟糕的解析可能导致文本块因编码错误而损坏,或导致表格被扁平化,从而引起大型语言模型(LLM)产生不准确或幻觉式的响应。开发了一个使用`pdfplumber`并针对合并单元格和单元格内换行符进行特定后处理规则的自定义管道来解决这些问题,证明了在重建表格结构以提高RAG性能方面准确性有所提高。
-
中国PDF解析器DeepDoc在日文文档上表现不一
对RAGFlow的DeepDoc(一款来自中国的开源文档解析器)的技术评估发现,在处理日文PDF时存在一个关键缺陷。该解析器在扫描或表单字体文档上系统性地将日本年号字符令误读为今,这可能导致法律和财务记录上的日期损坏。然而,这个问题仅限于DeepDoc的OCR回退路径;嵌入字体PDF的数字提取文本不受影响。尽管存在OCR错误,DeepDoc改进的布局理解能力使测试文档的词汇搜索系统的检索准确率提高了15%。
-
LocalLLaMA 用户寻求PDF预处理工具以获得更好的LLM输入
r/LocalLLaMA 子版块的用户正在讨论在将PDF文档输入本地大型语言模型之前进行预处理的方法。突出的主要挑战是处理具有复杂布局(如表格和多栏文本)的PDF,这通常会导致输入混乱和模型输出质量差。参与者正在寻求除PyMuPDF和pdfplumber等基本库之外的工具推荐,并对Docling和LlamaParse等处理更复杂文档的工具特别感兴趣。