研究人员为东干语开发了一个有限状态形态分析器,东干语是一种在中亚使用的汉藏语系语言。该模型使用HFST实现,涵盖甘肃和陕西方言,基于三个体裁的语料库量化了东干语的形态属性。分析显示,显性屈折很少见,在百科全书语域中只有9.3%的识别词元表现出显性标记,该系统只有十个类别。歧义是局部的,主要影响两个附着语,语法核心在很大程度上是封闭的,大多数失败归因于词汇缺失而非未实现的现象。研究得出结论,东干语的开放前沿在于其词汇,并且分析器、其来源和评估脚本已公开发布。 AI
排序理由 学术论文,详细介绍了语言分析模型及其发现。[lever_c_demoted from research: ic=1 ai=0.1]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →