研究人员正在开发用于大型语言模型中文本分词的新方法,以提高效率和性能。一种名为 SuTRA 的方法侧重于形态丰富的语言(如印地语、马拉地语和古吉拉特语)的形态结构,减少了碎片化并改进了机器翻译。另一项开发 TokEval 提供了一套评估分词器的指标,超越了基本的压缩,评估了 UTF-8 完整性和数字对齐等属性,这些属性与下游任务性能相关。此外,一项试点研究探索了使用轻量级自回归模型自动完成分词器,以压缩字节级序列,在不牺牲质量的情况下显著缩短了机器翻译的序列长度。 AI
影响 这些分词技术的进步可能带来更高效、更强大的语言模型,特别是在形态丰富的语言和机器翻译、代码生成等复杂任务方面。
排序理由 多篇 arXiv 论文介绍了用于语言模型中文本分词的新颖方法和评估套件。
在 Hugging Face Daily Papers 阅读 →
- arXiv
- Autoregressive byte language model
- Byte-level tokenization
- Chinese- English Parallel Texts for International Exhibition Publicity:a Comparison of Rhetoric and Translation Modes
- English--French
- Finnish--English
- machine translation
- Russian--English
- Transformer++
- Hugging Face
- TokEval
- UTF-8
- byte-pair encoding
- Gujarati
- Hindi
- Indic Languages
- Marathi
- SuTRA
AI 生成摘要 · Google Gemini · 来自 4 个来源。 我们如何撰写摘要 →