Common Crawl
PulseAugur coverage of Common Crawl — every cluster mentioning Common Crawl across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
图基础模型与GNNs的评估;新的Acacia模型在网络图上训练
两篇新的研究论文探讨了图基础模型(GFMs)的能力和局限性。第一篇论文NodeGround提出了一个基准,用于在各种数据集和标签可用性场景下系统地评估GFMs与传统图神经网络(GNNs)的性能,发现经过仔细调整的GNNs通常表现更好。第二篇论文介绍了Acacia,一个在Common Crawl网络图上训练的GFM,它展示了上下文学习和任务通用性,而无需依赖预训练的LLMs,这表明图模型可以独立发展出涌现能力。
-
7B模型ZGCM-1优先考虑工具使用和大型上下文,而非记忆
来自中关村学院和中关村人工智能研究院的研究人员开发了ZGCM-1,一个拥有73.9亿参数的模型,该模型优先考虑工具使用和大型上下文窗口,而不是记忆海量数据集。这种方法允许较小的模型通过按需检索信息来执行复杂任务,而不是试图将其内部存储。ZGCM-1利用混合注意力机制和FP8 Muon优化器,在其256K上下文窗口内实现高效处理,在搜索和数学基准测试中表现出色,可与更大模型相媲美。
-
Data Scout 方法改进了 AI 预训练语料库的创建
研究人员开发了一种名为 Data Scout 的新方法,用于创建专门的 AI 模型预训练语料库。与过滤大型网络存档的传统方法不同,Data Scout 基于 LLM 生成的分类法和搜索查询进行定向爬取。该方法使用用户提供的分类器来筛选子域,显著提高了收集数据的效率和质量。例如,使用数学分类器,Data Scout 在相关内容方面的比率比过滤 Common Crawl 高出 70 倍,而且重要的是,这些高质量数据中有很大一部分不存在于现有存档中。
-
Anthropic 因涉嫌盗用 AI 训练数据被起诉,索赔数十亿美元 · 跟踪 1 个来源
Anthropic 公司面临索尼音乐出版公司和华纳查普尔公司提起的重大诉讼,指控该公司的人工智能模型在未经许可的情况下,使用了数万首受版权保护的歌曲进行训练。原告寻求可能高达数十亿美元的赔偿,引用了每件侵权作品高达 15 万美元的法定损害赔偿,以及因删除版权管理信息而产生的额外罚款。此法律行动紧随 Anthropic 与作家就涉嫌侵犯版权达成的一项 15 亿美元的和解协议之后,这表明其数据获取实践存在潜在问题,可能给这家人工智能公司及…
-
发布新的视频预训练方法和千万小时级数据集
研究人员推出了一种新颖的视频预训练方法 LeVJEPA,该方法在保持或提高下游准确性的同时,显著降低了计算成本。该方法绕过了常见的启发式方法,如架构不对称和 EMA 目标编码器,而是使用单个编码器配合不变性损失和 SIGReg 正则化。同时,LAION-BVD 数据集已发布,提供千万小时的视频数据用于多模态预训练,这些数据源自通过 CommonCrawl 收集的 8000 万个视频。该数据集旨在通过提供大规模、开放访问的合成字幕资源来…
-
新的 GEO 策略旨在提高内容在 AI 搜索引擎中的可见性
文章概述了一种名为生成引擎优化 (GEO) 的策略,内容创作者可以通过该策略来提高其在 ChatGPT 和 Perplexity 等 AI 驱动的搜索引擎中的可见性。关键建议包括配置 robots.txt 以允许 AI 爬虫,创建 `llms.txt` 文件以进行结构化内容摘要,以及实施 JSON-LD 来构建实体图。作者还强调了结果优先的文案(包含具体数字)以及维护新鲜的内部链接内容的重要性。
-
研究:ChatGPT发布后超过35%的网页显示AI署名 · 追踪9个来源
皮尤研究中心最近的一项研究表明,自ChatGPT发布以来,超过三分之一的网页显示出AI署名或大量编辑的迹象。这一趋势在.com域名中尤为明显,其AI署名率约为.edu或.gov域名的十倍。该分析利用Open Pangram的技术对Common Crawl的大型数据集进行了分析,并指出与AI生成文本相关的风格标记有所增加。
-
新的SCRIBES框架使用可重用脚本提取Web数据
研究人员开发了SCRIBES,一个强化学习框架,旨在从半结构化的Web内容(如HTML表格和列表)中提取结构化信息。该方法通过利用同一网站内网页之间的布局相似性作为奖励信号来生成可重用的提取脚本,从而避免了资源密集型的每页LLM推理。该框架通过在CommonCrawl数据上的合成标注进行训练而得到改进,在脚本质量上优于现有方法,并提高了GPT-4o等模型下游问答的准确性。
-
论文揭示大语言模型语料库统计中的单位偏差,导致大量文本数据丢失
一篇新论文强调了大语言模型训练数据集测量方式上的一个显著差异,特别是在网页-PDF语料库方面。研究人员发现,统计数据通常以token为单位报告语料库大小,但以文档为单位计算指标,这导致了“单位偏差”。这种偏差意味着,一小部分文档,特别是那些超过50页或由TeX工具链生成的文档,包含了不成比例的大量文本。研究还显示,常见的截断上限(如5 MiB限制)会导致大量数据丢失,常用的库未能恢复截断文本的很大一部分。作者建议同时以文档和token…
-
孟加拉语大语言模型支持滞后是由于数据稀缺,而非需求不足
尽管孟加拉语拥有大量母语使用者,但其在大语言模型中的支持程度却远落后于使用者较少的语言。这种差距并非源于需求不足,而是由于可爬取、机器可读的文本数据稀缺。主要原因之一是历史上使用了自定义字体,将孟加拉语字符映射到ASCII,导致大量旧的数字内容对网络爬虫和语言检测工具不可见。虽然现代孟加拉语出版物使用Unicode,但历史语料库仍包含这些遗留数据,影响了模型训练。
-
新方法审计中文网络语料库以检测大模型污染
研究人员开发了一种名为 Sampled-BPE 的新方法,用于高效审计大型中文网络语料库中的大模型污染。与完整扫描相比,该技术显著降低了运行时间和内存使用量,同时保持了对污染类别的准确估计。该流程应用于多个公开的中文语料库和 Common Crawl 快照,揭示了普遍存在且随时间变化的污染。此外,还发布了一个包含上下文和类别信息的中文网络标记的详细数据集,以协助进一步分析和追踪污染。
-
AWS开放数据注册表获得MCP服务器以改进数据发现
AWS上的开放数据注册表是一个包含一千多个数据集的目录,它面临着一个接口问题,即尽管数据可用,但查找特定数据却很困难。一个新的MCP服务器旨在通过在代理对话中充当资格接口来解决这个问题,公开用于发现、元数据检查和访问路径识别的工具。虽然自然语言搜索效果不佳,但使用特定术语和过滤器的受限查询成功检索到了目标数据集及其相关的文档和资源,证明了该服务器在简化数据访问方面的潜力。
-
新的CuraWeb语料库通过优化数据策展提升LLM性能
研究人员开发了CuraWeb,一个包含2万亿token的新的英文语料库,旨在改进大型语言模型的预训练数据。与以往只关注单一优化目标的旧方法不同,CuraWeb采用了一种新颖的框架,能够联合优化数据的质量、冗余度和多样性。该方法利用双轨清理和混合去重技术,并通过多目标采样器进行平衡。实验表明,将CuraWeb应用于Common Crawl数据,其性能显著优于现有数据集,在各种基准测试中平均性能提升了1.8%,尤其是在知识密集型和推理任务方面。
-
LLM 因 WordPress 训练数据而使用破折号,而非固有偏好
大型语言模型(LLM)可能倾向于使用破折号,并非因为它们本身偏好,而是因为它们的训练数据包含了大量来自 WordPress 网站的内容。自 2003 年以来,WordPress 会自动将标准连字符(包括破折号)转换为其他字符。这意味着构成 LLM 训练数据基础的真实文本通常包含这些转换后的破折号。因此,AI 生成文本中出现破折号,更可能是训练数据来源的反映,而不是 AI 本身的固有特征。
-
独立开发者构建支持 Claude MCP 的免费反链检查器
一位独立开发者创建了一个免费的反链检查工具,该工具集成了 Claude 的 MCP(模型上下文协议)。这使得用户可以直接通过 Claude 的界面查询反链数据,例如域名资料和引荐域名。该系统利用 Common Crawl 数据,运行在低成本 VPS 上,开发者强调了实现 MCP 的简便性以及 Common Crawl 在此类项目中的强大功能。
-
新框架用发现曲线分析网络爬取数据
研究人员开发了一个新的框架,用于分析纵向网络爬取数据,即演变中的URL群体的顺序样本。该框架引入了“发现曲线”来衡量爬取窗口内的累积URL足迹。通过将发现曲线与成对包含分析进行比较,研究人员在应用于Common Crawl和德国学术网络档案时,发现了预测上的分歧。这些差异表明网络存在一个由持久核心和动态外壳组成的双组分模型,该模型能更好地调和观测到的数据。
-
CrawlGraph 为 AI 代理推出免费反向链接 API 级别
CrawlGraph 推出了其反向链接 API 的免费级别,每月提供 15 次调用,使用 Common Crawl 的开放超链接图数据。这个新级别允许用户访问约 1.2 亿个域名和 44 亿个链接的反向链接配置文件,无需注册或付款。通过电子邮件发送的 API 密钥也可以集成到 Claude 和 Cursor 等 AI 代理中,在对话中提供反向链接信息。
-
斯坦福发布 1520 亿 token 的金融 LLM 训练数据集
研究人员推出了斯坦福 EDGAR 备案数据集 (SEFD),这是一个新的开源语料库,旨在为大型语言模型(尤其是在金融领域)提供干净、长上下文的文档。该数据集将 SEC 备案文件重建为忠实于布局的格式,使其适用于金融语言建模,并支持预测和文档理解等任务。SEFD-v1 是初始版本,包含 1520 亿 token,而更大的存档估计为 5500 亿 token。该项目还推出了两个新基准 EDGAR-Forecast 和 EDGAR-OCR,…
-
《Pokémon Go》数据用于无人机导航,包括军事用途
据报道,Niantic 的地理空间模型最初使用《Pokémon Go》玩家扫描 PokéStop 的数据进行训练,现正被用于无人机导航,包括军事应用。尽管 Niantic 表示只有模型的早期版本使用了这些数据,并且 PokéStop 扫描功能最近已停用,但关于该数据最终用途以及该功能停用时机的疑问仍然存在。
-
Web graph structure guides language model pretraining data selection
研究人员开发了一种名为 WebGraphMix 的新方法,用于选择语言模型的预训练数据。该方法利用了网页图的结构来识别中心和外围文档,并假设中心主机提供可重用的抽象,而外围主机提供专业知识。实验表明,中心和外围数据的 1:1 混合在 23 项任务上的平均性能有所提高,优于均匀采样,并且在与文档级质量分类器结合使用时能进一步提升结果。