研究人员开发了NE-BERT,这是一种专为九种代表性不足的东北印度语言设计的新型多语言语言模型。该模型在约830万个句子上进行了训练,在这些低资源语言的困惑度和分词方面,其性能显著优于IndicBERT-V2和MuRIL等现有模型。NE-BERT通过积极的上采样解决了词汇碎片化问题,并在词性标注等下游任务中展示了实际效用,其代码和数据已发布,以促进进一步的NLP研究和数字包容性。 AI
影响 增强了代表性不足语言的NLP能力,可能催生新的应用和数字包容性。
排序理由 该集群描述了一篇关于专门语言模型的创建和评估的新学术论文。[lever_c_demoted from research: ic=1 ai=1.0]
- English
- Hindi
- Hugging Face
- IndicBERT-V2
- Kokborok
- multilingual-BERT
- NE-BERT
- Northeast Indian languages
- Pnar
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →