PDF.js
PulseAugur coverage of PDF.js — every cluster mentioning PDF.js across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
VEKTOR 2.0 发布,专注于本地数据和隐私
VEKTOR 2.0 已发布,提供了一个在用户计算机上运行的私有本地内存和助手层。该软件用 JavaScript 编写,并强调隐私增强技术和主权本地数据。它支持广泛的 AI 模型,旨在为内存和操作提供一个专注的业务工具,除非明确选择云模型,否则数据将保留在用户的机器上。
-
工具将 PDF 转换为 Markdown 以供 LLM 使用,助力 RAG 和数据提取
两篇文章讨论了将 PDF 文档转换为 Markdown 格式的方法,这种格式更易于 LLM 处理,用于检索增强生成 (RAG) 或提示包含等任务。第一篇文章比较了三个开源 Python 工具——MarkItDown、Docling 和 Marker——并评估了它们在各种 PDF 类型上的性能,指出 Docling 在处理复杂文档时提供了最佳输出质量,尽管处理速度较慢。第二篇文章介绍了一个名为 PDF Text Extractor 的 …
-
开发者推出LiteDoc以降低PDF处理的LLM代币成本
一位开发者创建了LiteDoc,这是一个免费的、客户端工具,旨在将PDF转换为Markdown格式,从而减少处理大型语言模型文档时所需的代币数量。该工具完全在用户的浏览器内运行,提取文本,隔离图像,并将内容构建成干净的Markdown,同时还能处理LaTeX数学和阿拉伯文本等复杂元素。通过在本地转换PDF,LiteDoc绕过了像Claude和ChatGPT等模型通常使用的、代币消耗量大的栅格化过程,显著减少了代币使用量和相关成本。
-
Simon Willison 构建了基于浏览器的 PDF 文本提取器 LiteParse
Simon Willison 创建了一个 LiteParse 的浏览器版本,LiteParse 是 LlamaIndex 的一个开源工具,用于从 PDF 中提取文本。这个新的网页版本使用 PDF.js 和 Tesseract.js 构建,允许用户直接在浏览器中处理 PDF,而无需单独的应用程序。该工具采用复杂的空间文本解析启发式方法来保持文档结构,并可选择使用 OCR 来处理基于图像的文本,还提供使用边界框进行视觉引用的功能。