研究人员开发了一个新的流程,用于精心策划专门针对欧洲葡萄牙语(PT-PT)的高质量网页语料库。该流程解决了巴西葡萄牙语的方言重叠和数据处理规模等挑战。它高效地处理了411 TB的原始数据,并包含了一个新颖的抓取后区块,通过防止过早丢弃有效文本,将文档产出率提高了19.04%。该框架包括严格的语言识别、加权模糊去重和神经质量分类,最终形成了一个干净且具有代表性的语料库,适用于LLM的预训练。 AI
影响 提供了一个可扩展的框架和一个为LLM预训练优化的干净语料库,有可能提高模型在欧洲葡萄牙语上的性能。
排序理由 该项目是一篇研究论文,详细介绍了一种新的数据策划方法。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Brazilian Portuguese
- European Portuguese
- Fine PT-PT Web
- Gonçalo Vinagre
- GV.Martins
- Hugging Face
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →