PulseAugur
实时 11:01:41
English(EN) Counting Documents Is Not Counting Text: Unit Bias in Web-PDF Corpus Statistics

论文揭示大语言模型语料库统计中的单位偏差,导致大量文本数据丢失

一篇新论文强调了大语言模型训练数据集测量方式上的一个显著差异,特别是在网页-PDF语料库方面。研究人员发现,统计数据通常以token为单位报告语料库大小,但以文档为单位计算指标,这导致了“单位偏差”。这种偏差意味着,一小部分文档,特别是那些超过50页或由TeX工具链生成的文档,包含了不成比例的大量文本。研究还显示,常见的截断上限(如5 MiB限制)会导致大量数据丢失,常用的库未能恢复截断文本的很大一部分。作者建议同时以文档和token为单位报告语料库统计数据,以更准确地反映数据集的构成。 AI

影响 强调了大语言模型训练数据中的关键数据质量问题,可能影响模型的性能和偏差。

排序理由 该集群包含一篇学术论文,详细介绍了关于数据统计的新发现。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

论文揭示大语言模型语料库统计中的单位偏差,导致大量文本数据丢失

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Luca Foppiano ·

    计算文档数量并非计算文本数量:网络-PDF语料库统计中的单位偏差

    arXiv:2608.16390v1 Announce Type: cross Abstract: PDF corpora advertise their size in tokens but compute every rate they publish (coverage, OCR routing, re-fetch recovery, language mix) per document, and none decomposes its token total. The two units diverge sharply. On CC-MAIN-2…