trafilatura
PulseAugur coverage of trafilatura — every cluster mentioning trafilatura across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
Dripper 框架提供高效的 HTML 提取,可与大型模型媲美
研究人员开发了 Dripper,一个用于高效、准确地从网页中提取主要内容的轻量级框架。该方法将提取重构为使用小型语言模型(SLM)的约束序列标注任务,从而消除了生成性幻觉并实现了高吞吐量。Dripper-0.6B 模型在该框架内,在新建的 WebMainBench 基准测试中,表现出与 DeepSeek-V3.2(685B)、GPT-5 和 Gemini 2.5 Pro 等大型模型相媲美的性能,提供了效率和准确性的最佳平衡。通过在 D…
-
Ragleap推出RAG库,专注于狭窄范围
Ragleap已推出其RAG库,强调刻意专注于狭窄范围而非广泛的功能对等。该库优先考虑检索增强生成,在其初始版本中明确排除了代理工具调用和多步编排,以确保核心功能得到良好执行。主要功能包括混合密集和稀疏检索、仅CPU交叉编码器重排序、对多个向量后端的支持以及对各种文件格式和媒体类型的强大摄取能力。
-
开发者为 AI 模型创建本地、无密钥的网络爬虫
一位开发者创建了一个名为 tearsheet 的本地、无密钥的网络抓取工具,旨在与 Claude Code 等 AI 模型一起使用。该工具旨在通过仅提取网页中的必要内容并避免广告和导航等不必要元素来降低 token 成本。Tearsheet 完全在用户的机器上运行,无需 API 密钥或外部服务,并通过对其局限性和潜在故障保持透明来优先考虑可信赖的数据提取。
-
本地AI代理通过自托管SearXNG和Scrapling获得网页访问权限
一位Reddit用户详细介绍了一种方法,可以在不依赖付费搜索或抓取API的情况下,为本地AI代理提供网页访问能力。该解决方案结合使用SearXNG进行自托管元搜索,以及Scrapling和Trafilatura进行页面内容提取。这种方法优先考虑控制权并避免使用特定供应商的API密钥,但也承认在速度方面存在权衡,并且可能面临Cloudflare的挑战。