一篇新论文强调了大语言模型训练数据集测量方式上的一个显著差异,特别是在网页-PDF语料库方面。研究人员发现,统计数据通常以token为单位报告语料库大小,但以文档为单位计算指标,这导致了“单位偏差”。这种偏差意味着,一小部分文档,特别是那些超过50页或由TeX工具链生成的文档,包含了不成比例的大量文本。研究还显示,常见的截断上限(如5 MiB限制)会导致大量数据丢失,常用的库未能恢复截断文本的很大一部分。作者建议同时以文档和token为单位报告语料库统计数据,以更准确地反映数据集的构成。 AI
影响 强调了大语言模型训练数据中的关键数据质量问题,可能影响模型的性能和偏差。
排序理由 该集群包含一篇学术论文,详细介绍了关于数据统计的新发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →