CrawlForge 团队发现其自动化测试套件存在严重缺陷,该套件基于过时或不存在的网站选择器而非实际的实时数据通过测试。为解决此问题,他们将 28 个网络抓取工具应用于 Amazon、Wikipedia 和 GitHub 等真实网站。此过程发现了并修复了大量缺陷,导致其工具发布了六个新版本,相关软件包发布了四个版本。此后,该团队重新调整了其抓取模板的重点,优先考虑网站发布的结构化数据(如 JSON 端点),而不是依赖 HTML 解析或 LLM 生成的数据。 AI
影响 此次更新提高了网络抓取工具的可靠性,而网络抓取工具是 AI 开发和研究中数据收集的基础。
排序理由 文章详细介绍了特定软件工具 CrawlForge MCP 的改进和发布,而不是新的模型发布或重大的行业性事件。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →