arXiv上的一篇新研究论文探讨了AI生成的文本对语言模型预训练的影响。研究发现,虽然为数据匮乏的模型添加AI生成的Token最初可以降低在人类文本上的损失,但随着更多AI文本的加入,这种好处会迅速转变为损害。对于在更大数据集上训练的模型,AI Token会立即增加损失。研究人员提出了一个新的缩放定律,该定律同时考虑了AI文本的益处和损害,并提出在目标是人类文本时过滤AI文本是有益的,同时建议为人类文本和AI生成的文本分别报告验证损失。 AI
影响 表明需要从训练数据集中过滤掉AI生成的内容,以维持模型在人类文本上的性能。
排序理由 在arXiv上发表的研究论文,详细介绍了关于预训练数据中AI生成文本的发现。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →