Common Crawl
PulseAugur coverage of Common Crawl — every cluster mentioning Common Crawl across labs, papers, and developer communities, ranked by signal.
8 天有情绪数据
-
新的 GEO 策略旨在提高内容在 AI 搜索引擎中的可见性
文章概述了一种名为生成引擎优化 (GEO) 的策略,内容创作者可以通过该策略来提高其在 ChatGPT 和 Perplexity 等 AI 驱动的搜索引擎中的可见性。关键建议包括配置 robots.txt 以允许 AI 爬虫,创建 `llms.txt` 文件以进行结构化内容摘要,以及实施 JSON-LD 来构建实体图。作者还强调了结果优先的文案(包含具体数字)以及维护新鲜的内部链接内容的重要性。
-
研究:ChatGPT发布后超过35%的网页显示AI署名 · 追踪9个来源
皮尤研究中心最近的一项研究表明,自ChatGPT发布以来,超过三分之一的网页显示出AI署名或大量编辑的迹象。这一趋势在.com域名中尤为明显,其AI署名率约为.edu或.gov域名的十倍。该分析利用Open Pangram的技术对Common Crawl的大型数据集进行了分析,并指出与AI生成文本相关的风格标记有所增加。
-
新的SCRIBES框架使用可重用脚本提取Web数据
研究人员开发了SCRIBES,一个强化学习框架,旨在从半结构化的Web内容(如HTML表格和列表)中提取结构化信息。该方法通过利用同一网站内网页之间的布局相似性作为奖励信号来生成可重用的提取脚本,从而避免了资源密集型的每页LLM推理。该框架通过在CommonCrawl数据上的合成标注进行训练而得到改进,在脚本质量上优于现有方法,并提高了GPT-4o等模型下游问答的准确性。
-
论文揭示大语言模型语料库统计中的单位偏差,导致大量文本数据丢失
一篇新论文强调了大语言模型训练数据集测量方式上的一个显著差异,特别是在网页-PDF语料库方面。研究人员发现,统计数据通常以token为单位报告语料库大小,但以文档为单位计算指标,这导致了“单位偏差”。这种偏差意味着,一小部分文档,特别是那些超过50页或由TeX工具链生成的文档,包含了不成比例的大量文本。研究还显示,常见的截断上限(如5 MiB限制)会导致大量数据丢失,常用的库未能恢复截断文本的很大一部分。作者建议同时以文档和token…
-
孟加拉语大语言模型支持滞后是由于数据稀缺,而非需求不足
尽管孟加拉语拥有大量母语使用者,但其在大语言模型中的支持程度却远落后于使用者较少的语言。这种差距并非源于需求不足,而是由于可爬取、机器可读的文本数据稀缺。主要原因之一是历史上使用了自定义字体,将孟加拉语字符映射到ASCII,导致大量旧的数字内容对网络爬虫和语言检测工具不可见。虽然现代孟加拉语出版物使用Unicode,但历史语料库仍包含这些遗留数据,影响了模型训练。
-
新方法审计中文网络语料库以检测大模型污染
研究人员开发了一种名为 Sampled-BPE 的新方法,用于高效审计大型中文网络语料库中的大模型污染。与完整扫描相比,该技术显著降低了运行时间和内存使用量,同时保持了对污染类别的准确估计。该流程应用于多个公开的中文语料库和 Common Crawl 快照,揭示了普遍存在且随时间变化的污染。此外,还发布了一个包含上下文和类别信息的中文网络标记的详细数据集,以协助进一步分析和追踪污染。
-
AWS开放数据注册表获得MCP服务器以改进数据发现
AWS上的开放数据注册表是一个包含一千多个数据集的目录,它面临着一个接口问题,即尽管数据可用,但查找特定数据却很困难。一个新的MCP服务器旨在通过在代理对话中充当资格接口来解决这个问题,公开用于发现、元数据检查和访问路径识别的工具。虽然自然语言搜索效果不佳,但使用特定术语和过滤器的受限查询成功检索到了目标数据集及其相关的文档和资源,证明了该服务器在简化数据访问方面的潜力。
-
新的CuraWeb语料库通过优化数据策展提升LLM性能
研究人员开发了CuraWeb,一个包含2万亿token的新的英文语料库,旨在改进大型语言模型的预训练数据。与以往只关注单一优化目标的旧方法不同,CuraWeb采用了一种新颖的框架,能够联合优化数据的质量、冗余度和多样性。该方法利用双轨清理和混合去重技术,并通过多目标采样器进行平衡。实验表明,将CuraWeb应用于Common Crawl数据,其性能显著优于现有数据集,在各种基准测试中平均性能提升了1.8%,尤其是在知识密集型和推理任务方面。
-
LLM 因 WordPress 训练数据而使用破折号,而非固有偏好
大型语言模型(LLM)可能倾向于使用破折号,并非因为它们本身偏好,而是因为它们的训练数据包含了大量来自 WordPress 网站的内容。自 2003 年以来,WordPress 会自动将标准连字符(包括破折号)转换为其他字符。这意味着构成 LLM 训练数据基础的真实文本通常包含这些转换后的破折号。因此,AI 生成文本中出现破折号,更可能是训练数据来源的反映,而不是 AI 本身的固有特征。
-
独立开发者构建支持 Claude MCP 的免费反链检查器
一位独立开发者创建了一个免费的反链检查工具,该工具集成了 Claude 的 MCP(模型上下文协议)。这使得用户可以直接通过 Claude 的界面查询反链数据,例如域名资料和引荐域名。该系统利用 Common Crawl 数据,运行在低成本 VPS 上,开发者强调了实现 MCP 的简便性以及 Common Crawl 在此类项目中的强大功能。
-
新框架用发现曲线分析网络爬取数据
研究人员开发了一个新的框架,用于分析纵向网络爬取数据,即演变中的URL群体的顺序样本。该框架引入了“发现曲线”来衡量爬取窗口内的累积URL足迹。通过将发现曲线与成对包含分析进行比较,研究人员在应用于Common Crawl和德国学术网络档案时,发现了预测上的分歧。这些差异表明网络存在一个由持久核心和动态外壳组成的双组分模型,该模型能更好地调和观测到的数据。
-
CrawlGraph 为 AI 代理推出免费反向链接 API 级别
CrawlGraph 推出了其反向链接 API 的免费级别,每月提供 15 次调用,使用 Common Crawl 的开放超链接图数据。这个新级别允许用户访问约 1.2 亿个域名和 44 亿个链接的反向链接配置文件,无需注册或付款。通过电子邮件发送的 API 密钥也可以集成到 Claude 和 Cursor 等 AI 代理中,在对话中提供反向链接信息。
-
斯坦福发布 1520 亿 token 的金融 LLM 训练数据集
研究人员推出了斯坦福 EDGAR 备案数据集 (SEFD),这是一个新的开源语料库,旨在为大型语言模型(尤其是在金融领域)提供干净、长上下文的文档。该数据集将 SEC 备案文件重建为忠实于布局的格式,使其适用于金融语言建模,并支持预测和文档理解等任务。SEFD-v1 是初始版本,包含 1520 亿 token,而更大的存档估计为 5500 亿 token。该项目还推出了两个新基准 EDGAR-Forecast 和 EDGAR-OCR,…
-
《Pokémon Go》数据用于无人机导航,包括军事用途
据报道,Niantic 的地理空间模型最初使用《Pokémon Go》玩家扫描 PokéStop 的数据进行训练,现正被用于无人机导航,包括军事应用。尽管 Niantic 表示只有模型的早期版本使用了这些数据,并且 PokéStop 扫描功能最近已停用,但关于该数据最终用途以及该功能停用时机的疑问仍然存在。
-
Web graph structure guides language model pretraining data selection
研究人员开发了一种名为 WebGraphMix 的新方法,用于选择语言模型的预训练数据。该方法利用了网页图的结构来识别中心和外围文档,并假设中心主机提供可重用的抽象,而外围主机提供专业知识。实验表明,中心和外围数据的 1:1 混合在 23 项任务上的平均性能有所提高,优于均匀采样,并且在与文档级质量分类器结合使用时能进一步提升结果。
-
AI 透明度辩论:“开放权重”不足,需要数据和价值洞察
文章《开放权重,封闭思想:AI 透明度究竟需要什么》认为,仅发布模型权重(一种被称为“开放权重”的做法)不足以实现真正的 AI 透明度。虽然这允许用户在不依赖企业云的情况下本地运行模型,但它模糊了关于训练数据、微调过程和嵌入价值观的关键细节。作者将此与 OLMo 和 Pythia 等真正开放的 AI 项目进行了对比,这些项目提供了对其训练数据和管道的完全可见性,并指出商业压力常常阻碍这种透明度。文章强调,像 Common Crawl …
-
Microsoft AI数据中心计划面临抗议,模型数据受质疑
在Microsoft的Build 2026大会上,其AI数据中心计划引发了抗议,主要关注电力消耗、用水量和社区批准问题。与此同时,该公司的MAI-Thinking-1模型因使用Common Crawl和公共网络数据进行训练而受到审查,尽管其声称使用了干净、已授权的数据。
-
Microsoft MAI 模型使用未经许可的网络数据进行训练
据报道,Microsoft 使用未经许可的网络数据训练了其 MAI 模型,这与其公开声称仅使用“企业级、干净且已获商业许可的数据”的说法相矛盾。该公司的做法与其他 AI 实验室类似,依赖于合理使用原则,并将数据收集的选择权留给网站所有者。
-
AI爬虫检查器解析10个主要AI爬虫的robots.txt
一款名为AI爬虫检查器的新工具已被开发出来,用于分析主要的AI爬虫如何与网站的robots.txt文件进行交互。该工具能够识别特定的AI爬虫,如OpenAI的GPTBot或Google的Google-Extended,是否被允许、屏蔽或部分屏蔽访问内容。该检查器解析robots.txt中复杂的指令,区分完全站点屏蔽和特定路径限制,从而提供对爬虫访问更细致的理解。
-
研究发现:语言模型过滤器导致认识论不公
一篇新发表在arXiv上的研究论文详细介绍了语言模型中的预训练过滤器和护栏如何导致认识论不公。审计发现,这些系统不成比例地标记与边缘化群体相关的内容,例如跨性别者、女性和中美洲人,但却常常未能检测到露骨的仇恨言论或私人信息。人工标注者会保留这些自动化系统标记的大部分内容,这凸显了它们在捕捉细微的代表性伤害方面的能力差距。