实体
pdfplumber
pdfplumber
PulseAugur coverage of pdfplumber — every cluster mentioning pdfplumber across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 0
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
中国PDF解析器DeepDoc在日文文档上表现不一
对RAGFlow的DeepDoc(一款来自中国的开源文档解析器)的技术评估发现,在处理日文PDF时存在一个关键缺陷。该解析器在扫描或表单字体文档上系统性地将日本年号字符令误读为今,这可能导致法律和财务记录上的日期损坏。然而,这个问题仅限于DeepDoc的OCR回退路径;嵌入字体PDF的数字提取文本不受影响。尽管存在OCR错误,DeepDoc改进的布局理解能力使测试文档的词汇搜索系统的检索准确率提高了15%。
-
LocalLLaMA 用户寻求PDF预处理工具以获得更好的LLM输入
r/LocalLLaMA 子版块的用户正在讨论在将PDF文档输入本地大型语言模型之前进行预处理的方法。突出的主要挑战是处理具有复杂布局(如表格和多栏文本)的PDF,这通常会导致输入混乱和模型输出质量差。参与者正在寻求除PyMuPDF和pdfplumber等基本库之外的工具推荐,并对Docling和LlamaParse等处理更复杂文档的工具特别感兴趣。