PulseAugur
实时 08:27:44
English(EN) PERCEPT: A Corpus for POS Tagging and Analysis of Persian-English Code-Mixing

新语料库PERCEPT支持波斯语-英语混合语分析

研究人员推出了PERCEPT,这是首个用于分析波斯语-英语混合语的大规模语料库,专门针对混合语词汇的词性(POS)标注。该新数据集包含来自X、Instagram和Digikala等平台的6800个帖子,并附带了通用依存关系词性标注。研究中采用了由大型语言模型(LLM)辅助的标注框架,其结果与人工评估高度一致,验证了其可靠性。该语料库首次实现了对波斯语-英语混合语的全面语言学分析,揭示了名词是混合语中最常见的词性类别,并且混合语在不同平台上的出现频率一致,而在Digikala上观察到的触发效应更强。 AI

影响 支持面向混合语的自然语言处理(NLP)模型的开发,以及对多语言社交媒体交流更深入的语言学理解。

排序理由 该条目描述了一个针对特定语言现象的新语料库及相关分析,符合研究类别。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新语料库PERCEPT支持波斯语-英语混合语分析

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Ghazal Kalhor, Zahra Jafari, Amirarsalan Shahbazi, Behnam Bahrak ·

    PERCEPT:波斯语-英语代码混合的词性标注和分析语料库

    arXiv:2608.10109v1 Announce Type: new Abstract: Social media has become a major venue for multilingual communication, where users frequently mix multiple languages within a single utterance. Although code-mixed corpora have been developed for several language pairs, Persian-Engli…