PulseAugur
实时 09:15:49

新方法为代表性不足的语言适配分词器

研究人员开发了一种方法,可以在不改变模型词汇量大小的情况下,为代表性不足的语言适配字节级BPE分词器。这种称为BPE引导插入的方法确保新的分词分配与现有的合并图兼容,解决了“合并排序问题”。该技术应用于Nemotron和GPT-OSS的乌克兰语适配版本,显著减少了乌克兰语的词元数量,同时保持了对英语和其他欧洲语言的最小改动。该研究还发布了所有相关的分词器和代码。 AI

影响 这项研究可以提高LLM在更广泛语言中的效率和性能。

排序理由 该集群包含一篇学术论文,详细介绍了NLP模型中分词器适配的新方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CL 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新方法为代表性不足的语言适配分词器

报道来源 [1]

  1. arXiv cs.CL TIER_1 English(EN) · Bohdan Didenko (Lviv Polytechnic National University) ·

    Writing-System-Level Tokenizer Adaptation for Byte-Level BPE

    arXiv:2608.00582v1 Announce Type: new Abstract: Pretrained byte-level BPE tokenizers can segment underrepresented languages inefficiently. Replacing a tokenizer changes the meaning of nearly every token ID, while vocabulary expansion enlarges the model's embedding and output matr…