研究人员推出了一种新的、与语言无关的标记器创建方法——Latent Core Tokenizer (LCT),该方法优先考虑有意义的语言单元发现而非简单的压缩。与传统的字节对编码 (BPE) 和 Unigram 等方法不同,LCT 在词汇表构建之前采用最小描述长度和形态句法约束来识别可重用单元。在对 104 种语言的评估中,LCT 在生育率和 MorphScore 方面优于现有方法,同时在跨语言差异方面也表现相当。此外,LCT 在多语言下游基准测试中的综合得分比其前代产品提高了多达 2.00 分,这表明单纯的压缩不足以获得最佳的表示质量。 AI
影响 这种新的标记器方法可能带来更高效、更准确的多语言自然语言处理模型。
排序理由 该集群包含一篇详细介绍新标记器方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- byte-pair encoding
- Hugging Face
- Latent Core Tokenizer
- minimum description length
- MorphScore
- Parity-aware BPE
- Unigram
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →