PulseAugur
实时 09:39:45
English(EN) Tangut Word Segmentation under Extreme Resource Scarcity: Integrating Traditional Lexicons and Unlabeled Text

已灭绝的唐古特语分词实现高精度

研究人员开发了一种新颖的唐古特语分词方法,唐古特语是一种已灭绝的、缺乏明确词语边界的语言。他们的框架整合了传统词典和无标签文本,并使用通过掩码语言模型(MLM)预训练的字符编码器。该方法在片段级交叉验证中实现了约0.91的高F1分数,证明了其在有限监督词汇之外的有效泛化能力。 AI

影响 这项研究推进了低资源和已灭绝语言的自然语言处理技术,可能为历史语言学和数字人文领域开辟新途径。

排序理由 详细介绍自然语言处理任务新方法的学术论文。[lever_c_research降级:ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

已灭绝的唐古特语分词实现高精度

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Lifan Deng, Yongwei Zhang, Sen Sun, Bojun Sun, Jingsong Yu ·

    极度资源匮乏下的唐古特词语切分:融合传统词典与无标签文本

    arXiv:2608.18437v1 Announce Type: new Abstract: Tangut is an extinct language whose script does not explicitly mark word boundaries. We present the first systematic study of Tangut word segmentation using 2,750 expert-annotated segments(31,893 tokens), traditional lexicons, and u…