名为5-Dialects-BN的新基准数据集已发布,以解决区域孟加拉语方言在大型语言模型中资源匮乏的问题。该数据集包含横跨五种主要方言(吉大港、巴里萨尔、诺阿卡利、锡尔赫特和兰加尔普尔)的6,000个手动标注条目。每个条目都包含方言文本、罗马音转写、英文翻译、标准孟加拉语翻译和主观性标签的对齐标注,旨在提高LLM在低资源、方言多样化语言上的性能。 AI
影响 支持为代表性不足的孟加拉语方言开发和评估LLM,可能提高数百万人的自然语言处理可及性。
排序理由 该项目是一篇学术论文,详细介绍了一个用于自然语言处理研究的新数据集。[lever_c_demoted from research: ic=1 ai=1.0]
- 5-Dialects-BN
- Bangla
- Barishal District
- Chittagong
- Hugging Face
- LoRA+
- Mir Sazzat Hossain
- Noakhali
- Rangpur
- Sylhet
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →