研究人员开发了IHUBERT,一个基于RoBERTa-base编码器的新波斯语语言模型。该模型在Sepahr-Danesh集合中一个45 GB的精选数据集上进行了训练,总计约70-80亿个token。IHUBERT采用多阶段预处理流程,包括语义去重,以提高语料库质量并平衡领域表示。该模型在各种自然语言理解基准测试中表现强劲,尤其在抽取式问答任务中表现出色。 AI
影响 推进了波斯语语言建模能力,并为波斯语的NLU任务设定了新的基准。
排序理由 该集群描述了一篇详细介绍语言模型创建和评估的新研究论文。
- DigiMag
- FarsTail
- Hugging Face
- IHUBERT
- ParsiNLU-RC
- ParsTwiNER
- PERLEX
- Pquadro
- Sepahr-Danesh
- byte-pair encoding
- WordPiece
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →