byte-pair encoding
PulseAugur coverage of byte-pair encoding — every cluster mentioning byte-pair encoding across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
LLM分词器解析:为什么提示在不同模型上的成本不同
理解LLM分词器的工作原理对于管理成本和预测模型行为至关重要。分词器通常基于字节对编码(BPE),将文本分解为模型作为整数处理的子词单元。这些单元在训练数据中的频率决定了文本如何被分块,导致像Claude、Gemini和OpenAI的GPT系列等不同模型对相同文本的标记计数存在差异。虽然OpenAI提供了开源工具`tiktoken`进行精确计数,但其他模型需要特定的API端点来进行准确的标记估算。
-
新研究探索用于大型语言模型的高级分词,提高效率和性能 · 已追踪 4 个来源
研究人员正在开发用于大型语言模型中文本分词的新方法,以提高效率和性能。一种名为 SuTRA 的方法侧重于形态丰富的语言(如印地语、马拉地语和古吉拉特语)的形态结构,减少了碎片化并改进了机器翻译。另一项开发 TokEval 提供了一套评估分词器的指标,超越了基本的压缩,评估了 UTF-8 完整性和数字对齐等属性,这些属性与下游任务性能相关。此外,一项试点研究探索了使用轻量级自回归模型自动完成分词器,以压缩字节级序列,在不牺牲质量的情况下…
-
Superword分词算法实现超过600倍加速
研究人员开发了BoundlessBPE和SuperBPE算法的显著加速实现,这些算法将字节对编码(BPE)扩展为创建“superwords”(超级词),将多个预分词组合在一起。之前的版本速度慢得不切实际,在小数据集上训练需要数天。新方法按频率聚合超级合并候选,避免了将整个文档加载到内存的需求,实现了超过600倍的加速,将训练时间缩短到几分钟。Python和Rust的实现现已开源。
-
新方法通过词汇表估计LLM训练数据构成
研究人员开发了一种名为量化引导密度估计(QGDE)的新方法,用于估计大型语言模型(LLM)的隐藏训练语料库的构成。该技术利用已发布的tokenizer词汇表,表明token ID到比例的分布在不同语料库中是稳定的。QGDE使用量化趋势和局部密度加权来近似这些分布,在受控和现实场景中都实现了低估计误差,包括使用SmolLM tokenizer。研究结果表明,tokenizer词汇表可以提供对细粒度语料库估计的有价值的见解,超越了广泛的混合推断。
-
分词被证明是NP完全和APX难的,即使对于二元字母表
一篇新的研究论文表明,分词(自然语言处理中的一个基本过程)即使在有界字母表上也是计算上不可行的。该研究证明,无论是自顶向下还是直接分词方法,即使仅限于二元字母表,都是NP完全和APX难的。这些发现表明,分词的固有难度并非源于复杂的构造或大的字母表,而是一个基本障碍,解释了BPE和UnigramLM等当前算法的启发式性质,并强调了未来研究中对近似算法的需求。
-
字节对编码解释:从压缩到自然语言处理
本文解释了字节对编码(BPE),一种用于神经机器翻译的数据压缩算法。BPE 的工作原理是通过反复识别语料库中最频繁的相邻字符对,并用新符号替换它们。该过程纯粹是统计性的,不包含对语言、形态或含义的内在理解。作者提供了 Python 代码来演示 BPE 合并的训练和后续的编码过程,并强调了该算法如何通过频率计数来发现常见的词缀。
-
字节级AI模型可节省参数并改进文本处理
一种用于AI处理的字节级模型通过直接处理256种可能的字节值,克服了传统分词模型的缺点,无需词汇表及其相关的嵌入表。这种方法将大量参数预算(在7B模型上可能为15%)释放出来用于实际层,而不是词汇查找。字节级模型还通过避免词汇外问题和分词不匹配,提供了对不同脚本、代码和噪声文本更鲁棒的处理能力,尽管它们仍然会产生与文本UTF-8编码成比例的成本。
-
Pruned BPE 通过优化可见词汇表来提高分词效率
研究人员推出了一种新颖的方法 Pruned BPE,用于增强子词分词的 Byte Pair Encoding (BPE)。与将所有学习到的合并标记暴露给下游模型的标准 BPE 不同,Pruned BPE 会识别并将低曝光标记指定为仅内部合并节点。此方法将其词汇槽重新分配给更常用的标记,从而实现更高效的可见词汇表。实验表明,在英语和中文语料库上,Pruned BPE 与 Standard BPE 相比,始终能缩短编码长度,在不影响语言模…
-
新方法为代表性不足的语言适配分词器
研究人员开发了一种方法,可以在不改变模型词汇量大小的情况下,为代表性不足的语言适配字节级BPE分词器。这种称为BPE引导插入的方法确保新的分词分配与现有的合并图兼容,解决了“合并排序问题”。该技术应用于Nemotron和GPT-OSS的乌克兰语适配版本,显著减少了乌克兰语的词元数量,同时保持了对英语和其他欧洲语言的最小改动。该研究还发布了所有相关的分词器和代码。
-
新的 Token 原生存储方法或将使 AI Agent 受益
一篇新的研究论文提出“Token 原生存储”作为一种更有效的方法来存储 AI Agent 使用的文本数据。该论文建议直接将文本存储为 Token ID,而不是传统的 UTF-8 编码,因为 Token ID 是语言模型处理的内容。这种方法通过消除字符和 Token 格式之间持续转换的需要,可以显著减小存储大小并加快数据访问速度,潜在速度提升高达 600 倍。作者还提倡在不同模型系列之间标准化 Tokenizer,以实现 Token 化…
-
新的PCAP-LM表示使LLM能够分析网络流量
研究人员开发了PCAP-LM,这是一种新颖的文本表示方法,旨在使网络流量数据与大型语言模型(LLM)兼容。该方法使用一种称为PacketGlyphs的自定义字母表来语义化地总结数据包信息,实现了812倍的尺寸缩减,并将整个捕获数据装入LLM的上下文窗口。评估表明,使用PCAP-LM,LLM在取证问答任务中可以达到99.3%的准确率,在有限上下文的标准文本表示方面表现出色。
-
新的JOLT方法优化分词,优于BPE
研究人员开发了一种名为联合优化贪婪最长匹配分词(JOLT)的新方法,以改进子词词汇训练。JOLT将词汇学习表述为整数规划问题,确保优化后的分词与实践中使用的贪婪最长匹配解码一致,这与以往基于启发式的方法(如字节对编码(BPE))不同。该方法通过求解线性规划松弛并选择性地添加高阶分词来扩展。JOLT展示了显著的改进,缩小了BPE留下的89.6-99.4%的压缩差距,并在保留数据上产生的词元数量减少了多达0.78%。
-
新的BHARATI分词器提高了古典印度语言的效率
研究人员开发了BHARATI,这是一套专为梵语和泰米尔语等古典印度语言设计的新分词器。与难以处理这些语言的黏着语形态和 संधि(sandhi)的标准算法不同,BHARATI实现了更有效的分段。这导致序列长度缩短,有效地增加了下游语言模型的上下文窗口,并提高了在专门的印度知识体系术语上的性能。
-
GPT-2 的字节级 BPE 词元化确保了完全覆盖,避免了词汇外问题
GPT-2 论文通过在 UTF-8 字节而非 Unicode 码点上使用字节对编码 (BPE) 来引入词元化的重大进展。这种字节级 BPE 方法保证了任何输入字符串,包括任何语言、表情符号或格式错误的文本,都不会出现词汇外的情况,这是通过仅包含 256 个可能的字节值的较小基础词汇表实现的。为了防止出现次优合并,例如为“dog”、“dog.”和“dog?”创建单独的词元,GPT-2 实现阻止了跨字符类别(如字母和标点符号)的合并,同时…
-
语言模型微调以翻译无空格的高棉语
一个语言模型被微调以翻译高棉语,这是一种单词之间没有空格的语言,使用了8000个句子和单个GPU的数据集。该过程涉及调整WordPiece和字节对编码等分词方法,这些方法通常用于像标准中文、英文和日文这样的有空格的语言。这项实验探讨了GPT-3和Bert等模型处理此类语言挑战的能力。
-
新的分词器方法改进了大型语言模型中跨语言同形异义词的处理
研究人员发现多语言语言模型存在一个局限性,即共享的子词词汇表可能导致相同的表面形式在不同语言中被过于统一地对待,即使它们的含义不同。他们提出了一种使用语言线索的分词器级别的干预方法,以改进对跨语言同形异义词和假朋友的处理。该方法包括在构建词汇表时,用特定语言的字符替换共享词汇单词的初始字符。虽然内在分析表明这种干预有助于 SaGe 分词器更强地发散,但下游机器翻译实验仅取得了适度的改进,特别是对于 BPE,但并非在所有语言中都一致。
-
理解 GPT:令牌、Transformer 和训练详解
本文提供了一份关于理解生成式预训练 Transformer(GPT)的实用指南,解释了它们是用于处理和预测令牌序列的神经网络语言模型。文章详细介绍了 GPT 的含义,即生成式(Generative)、预训练(Pre-trained)和 Transformer(Transformer),并强调了 Transformer 架构使用了“Attention Is All You Need”论文中引入的注意力机制。该指南还解释了令牌化(toke…
-
新的分词器和操作指南旨在降低LLM的Token成本
研究人员开发了Thunder-Tok,一种新的子词分词器,旨在在不牺牲大型语言模型性能的情况下减少Token数量。与标准的BPE分词器相比,该方法在英语中实现了约25%的词条数缩减,在韩语中实现了9%。同时,一份针对Claude等模型优化Token使用的操作指南正在分享,重点在于压缩输入并将任务智能地路由到更便宜的模型以提高效率。这些策略旨在降低推理成本并提高LLM应用的成本效益。
-
新的分词方法提升了NLP的跨语言公平性
研究人员开发了一种名为Parity-Aware Byte-Pair Encoding (BPE) 的新分词算法,以解决自然语言处理中的跨语言公平性问题。传统的BPE方法偏向于主导语言,导致低资源语言的分词更长或效果不佳。新的Parity-aware BPE算法修改了合并步骤,优先压缩压缩效果最差的语言,显著减少了分词不平等。该方法在减少分词不平等方面显示出高达89%的相对改进,对整体压缩率影响很小,且对下游语言模型的性能没有损害。
-
BPE 对比 Unigram-LM:分词算法为化学 SMILES 创建了不同的词汇表
一篇新的研究论文探讨了两种常见的分词方法——字节对编码 (BPE) 和 Unigram-LM——在应用于化学 SMILES 字符串时产生的差异。研究发现,这些算法会产生显著不同的词汇表,其中 Unigram-LM 将分子分割成比 BPE 更多的 token。这表明子词算法的选择对于化学语言模型来说是一个关键的建模决策,而不是一个默认设置。