研究人员开发了TabuLM,一个专门为卢旺达语(一种在卢旺达使用的低资源班图语)表格数据预训练的新型语言模型。该模型通过针对表格结构设计的新嵌入和注意力机制增强了KinyaBERT-large。TabuLM使用掩码单元恢复和列类型预测目标,在卢旺达政府表格上进行了训练,并引入了TabQA-kin,一个用于卢旺达语表格问答的新基准,TabuLM在该基准上显著优于现有的多语言模型。 AI
影响 这项工作推动了低资源语言和表格数据的表示学习,有可能在新兴地区启用新的应用,这些地区在语言资源方面有限。
排序理由 该项目描述了一篇介绍低资源语言新型语言模型和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
在 Hugging Face Daily Papers 阅读 →
- Column Type Prediction
- KinyaBERT-large
- Kinyarwanda
- Masked Cell Recovery
- multilingual-BERT
- Rwanda
- TabQA-kin
- XLM-RoBERTa
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →