研究人员推出了PERCEPT,这是首个用于分析波斯语-英语混合语的大规模语料库,专门针对混合语词汇的词性(POS)标注。该新数据集包含来自X、Instagram和Digikala等平台的6800个帖子,并附带了通用依存关系词性标注。研究中采用了由大型语言模型(LLM)辅助的标注框架,其结果与人工评估高度一致,验证了其可靠性。该语料库首次实现了对波斯语-英语混合语的全面语言学分析,揭示了名词是混合语中最常见的词性类别,并且混合语在不同平台上的出现频率一致,而在Digikala上观察到的触发效应更强。 AI
影响 支持面向混合语的自然语言处理(NLP)模型的开发,以及对多语言社交媒体交流更深入的语言学理解。
排序理由 该条目描述了一个针对特定语言现象的新语料库及相关分析,符合研究类别。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →