PulseAugur
中
实时 17:36:37
实体 byte-pair encoding

byte-pair encoding

PulseAugur coverage of byte-pair encoding — every cluster mentioning byte-pair encoding across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
51
90 天内 51
发布 · 30天
0
90 天内 0
论文 · 30天
42
90 天内 42
层级分布 · 90 天
主题
关系
情绪 · 30 天

8 天有情绪数据

最近 · 第 1/3 页 · 共 53 条
  1. TOOL · CL_277344 ·

    新的通用字节级编码提升了多语言文本的 LLM 效率

    研究人员开发了一种通用字节级编码 (UBE),以提高多语言大型语言模型的效率。UBE 解决了某些脚本在标准字节对编码 (BBPE) 分词器中产生更高 token 成本的问题,从而导致费用增加和上下文窗口减小。通过将特定脚本的字符通过 UTF-16 进行路由,UBE 在不负面影响英语文本效率的情况下,降低了高溢价脚本的分词成本。该方法保持了精确解码,并已被验证可以往返所有 Unicode 标量值并通过各种 Unicode 测试套件。

  2. RESEARCH · CL_270688 ·

    AI研究致力于提高效率和降低成本的token压缩技术 · 追踪6个来源

    研究人员正在探索压缩AI模型中token表示的新方法,旨在提高效率和降低计算成本。一篇论文引入了“压缩证书”来量化token边界的成本,发现边界会显著增加像英语这样的语言的token数量。另一项研究提出了“Aperture”,它存储压缩token的傅里叶矩以保留位置信息,在视频问答任务中显示出具有竞争力的准确性。第三篇论文“Braco”专注于视觉语言模型的极端视觉token压缩,在大幅减少FLOPs和延迟的同时实现了高准确性。此外,一…

  3. TOOL · CL_259278 ·

    新研究论文探讨了波兰语分词的局限性

    一篇新研究论文探讨了字节对编码(BPE)分词应用于像波兰语这样高度屈折的语言时所存在的局限性。研究表明,依赖统计频率的BPE常常无法捕捉到语言学上的重要单元,例如语法结尾、词族或说话主体的概念。这可能导致语言模型在对话中难以保持语法一致性和稳定的自我意识,尤其是在处理动词和第一人称代词等复杂形式时。该论文提出了“分段屈折形式”的框架,以更好地评估分词边界,并建议对波兰语进行更鲁棒的建模需要改进次词稳定性和语法锚定。

  4. TOOL · CL_259243 ·

    新研究解构语言模型的分词算法

    研究人员引入了两种新的分词算法,BottomUpLL 和 TopDownComp,以解构语言模型分词器中优化目标和搜索程序的影响。通过创建一个 2x2 的设计空间,他们比较了自下而上和自上而下的方法与压缩和对数似然目标。他们的发现表明,搜索程序而不是目标是性能的主要驱动因素,自下而上的分词器通常能实现更低的每字节比特数。然而,在 BLiMP 任务上,设计选择与性能之间没有发现一致的关系。

  5. RESEARCH · CL_259294 ·

    首个使用圣经语料库开发的英叙机器翻译模型

    研究人员开发了首个用于英译叙利亚语的基于短语的统计机器翻译(SMT)模型,解决了翻译一种拼写复杂且濒危语言的挑战。该研究创建了一个包含近40,000对句子的圣经数据集,采用自定义脚本和人工审查进行对齐。所得模型达到了23.54的BLEU分数,人工评估显示性能尚可,为叙利亚语未来的自然语言处理(NLP)工作奠定了基础。

  6. TOOL · CL_251997 ·

    研究发现:梵语分词惩罚高于英语

    一项新的研究论文调查了现代语言模型处理梵语与英语和印地语相比的分词效率。研究发现,与英语相比,梵语每单位含义所需的Token数量明显更多,尤其是在使用具有大型词汇表的已部署分词器时。然而,与印地语相比,梵语的分词惩罚有所降低,并且随着词汇量的增大,差距进一步缩小。研究表明,虽然梵语的每词信息密度很高,但其复杂的形态学在实际应用中会导致每条命题的Token数量更高。

  7. COMMENTARY · CL_250872 ·

    大型语言模型通过数值分词处理语言,而非理解

    神经网络,包括大型语言模型,并不内在理解人类语言;相反,它们通过将文本转换为数值表示来处理文本。这个过程称为分词,它将文本分解成更小的单元,如单词或子词,然后为这些单元分配唯一的数值标识符。像字节对编码(Byte-Pair Encoding)和WordPiece这样的高级技术被普遍采用,以管理词汇量并有效处理多样化的语言。

  8. TOOL · CL_245480 ·

    新的DH-BPE方法优化语言模型词汇表以实现更好的压缩

    研究人员开发了一种名为动态规划引导分层BPE(DH-BPE)的新方法,用于优化语言模型的词汇表构建。该方法结合了标记暴露和BPE训练中的分层依赖关系,使用动态规划进行效用测量和剪枝,以选择固定大小的词汇表。DH-BPE在压缩方面持续优于标准BPE和其他基线,为在固定预算内优化词汇表分配提供了一种实用的方法。

  9. RESEARCH · CL_245231 ·

    BuzzASR发布100多款语言专用语音模型,性能超越Whisper

    研究人员开发了BuzzASR,这是一套经过微调的、针对不同语言的100多款专用语音识别模型。这些模型基于Whisper架构,在许多语言上,特别是原始训练数据中代表性较低的语言上,其性能显著优于通用的Whisper Large V3模型。BuzzASR模型在27种语言的开源系统中达到了最先进的字符错误率,并引入了一种改进压缩率的分词器替换策略。

  10. TOOL · CL_229419 ·

    EvoLen 分词器利用进化数据构建 DNA 语言模型

    研究人员开发了 EvoLen,一种用于 DNA 语言模型 (DNALMs) 的新型分词方法,该方法整合了进化信息。与自然语言中使用的标准字节对编码 (BPE) 不同,EvoLen 利用跨物种进化信号,优先考虑功能性序列模式,如调控基序。这种方法旨在为 DNALMs 创建更具生物学意义和可解释性的序列表示。实验表明,EvoLen 在保留功能性模式和符合进化约束方面有所改进,同时在各种 DNALM 基准测试上的表现与 BPE 相当。

  11. COMMENTARY · CL_227712 ·

    LLM分词详解:文本如何转化为AI模型的数字表示

    大型语言模型(LLM)在处理文本前,需要将其转换为称为“标记”(token)的数字表示。一个标记可以是一个词、词的一部分或标点符号,每个标记都被分配一个唯一的标记ID。不同的LLM使用不同的分词器,导致相同的文本可能拥有不同的标记ID。像字节对编码(BPE)、字节级BPE(BBPE)和WordPiece等算法被用来管理词汇量大小和序列长度,以解决字符级分词中固有的词汇外(out-of-vocabulary)单词和长序列等问题。处理的标…

  12. RESEARCH · CL_226795 ·

    嵌套字节级词汇表提供部署灵活性但会降低语言模型性能

    一篇新的研究论文探讨了语言模型的嵌套字节级词汇表概念,证明虽然将模型切片以在不同词汇表大小下运行在数值上是精确的,并且可以将部署的权重减少 66%,但会带来性能成本。研究发现,共享模型比专用模型在每字节比特数上落后近 3-4%。进一步分析表明,控制令牌的影响微乎其微,而输出限制会带来性能损失。尽管存在这些缺点,多容量训练可提高模型对印刷噪声的鲁棒性。

  13. COMMENTARY · CL_207033 ·

    LLM分词器解析:为什么提示在不同模型上的成本不同

    理解LLM分词器的工作原理对于管理成本和预测模型行为至关重要。分词器通常基于字节对编码(BPE),将文本分解为模型作为整数处理的子词单元。这些单元在训练数据中的频率决定了文本如何被分块,导致像Claude、Gemini和OpenAI的GPT系列等不同模型对相同文本的标记计数存在差异。虽然OpenAI提供了开源工具`tiktoken`进行精确计数,但其他模型需要特定的API端点来进行准确的标记估算。

  14. RESEARCH · CL_206281 ·

    新研究探索用于大型语言模型的高级分词,提高效率和性能 · 已追踪 4 个来源

    研究人员正在开发用于大型语言模型中文本分词的新方法,以提高效率和性能。一种名为 SuTRA 的方法侧重于形态丰富的语言(如印地语、马拉地语和古吉拉特语)的形态结构,减少了碎片化并改进了机器翻译。另一项开发 TokEval 提供了一套评估分词器的指标,超越了基本的压缩,评估了 UTF-8 完整性和数字对齐等属性,这些属性与下游任务性能相关。此外,一项试点研究探索了使用轻量级自回归模型自动完成分词器,以压缩字节级序列,在不牺牲质量的情况下…

  15. TOOL · CL_196098 ·

    Superword分词算法实现超过600倍加速

    研究人员开发了BoundlessBPE和SuperBPE算法的显著加速实现,这些算法将字节对编码(BPE)扩展为创建“superwords”(超级词),将多个预分词组合在一起。之前的版本速度慢得不切实际,在小数据集上训练需要数天。新方法按频率聚合超级合并候选,避免了将整个文档加载到内存的需求,实现了超过600倍的加速,将训练时间缩短到几分钟。Python和Rust的实现现已开源。

  16. TOOL · CL_196068 ·

    新方法通过词汇表估计LLM训练数据构成

    研究人员开发了一种名为量化引导密度估计(QGDE)的新方法,用于估计大型语言模型(LLM)的隐藏训练语料库的构成。该技术利用已发布的tokenizer词汇表,表明token ID到比例的分布在不同语料库中是稳定的。QGDE使用量化趋势和局部密度加权来近似这些分布,在受控和现实场景中都实现了低估计误差,包括使用SmolLM tokenizer。研究结果表明,tokenizer词汇表可以提供对细粒度语料库估计的有价值的见解,超越了广泛的混合推断。

  17. TOOL · CL_193754 ·

    分词被证明是NP完全和APX难的,即使对于二元字母表

    一篇新的研究论文表明,分词(自然语言处理中的一个基本过程)即使在有界字母表上也是计算上不可行的。该研究证明,无论是自顶向下还是直接分词方法,即使仅限于二元字母表,都是NP完全和APX难的。这些发现表明,分词的固有难度并非源于复杂的构造或大的字母表,而是一个基本障碍,解释了BPE和UnigramLM等当前算法的启发式性质,并强调了未来研究中对近似算法的需求。

  18. TOOL · CL_188644 ·

    字节对编码解释:从压缩到自然语言处理

    本文解释了字节对编码(BPE),一种用于神经机器翻译的数据压缩算法。BPE 的工作原理是通过反复识别语料库中最频繁的相邻字符对,并用新符号替换它们。该过程纯粹是统计性的,不包含对语言、形态或含义的内在理解。作者提供了 Python 代码来演示 BPE 合并的训练和后续的编码过程,并强调了该算法如何通过频率计数来发现常见的词缀。

  19. TOOL · CL_188645 ·

    字节级AI模型可节省参数并改进文本处理

    一种用于AI处理的字节级模型通过直接处理256种可能的字节值,克服了传统分词模型的缺点,无需词汇表及其相关的嵌入表。这种方法将大量参数预算(在7B模型上可能为15%)释放出来用于实际层,而不是词汇查找。字节级模型还通过避免词汇外问题和分词不匹配,提供了对不同脚本、代码和噪声文本更鲁棒的处理能力,尽管它们仍然会产生与文本UTF-8编码成比例的成本。

  20. TOOL · CL_180481 ·

    Pruned BPE 通过优化可见词汇表来提高分词效率

    研究人员推出了一种新颖的方法 Pruned BPE,用于增强子词分词的 Byte Pair Encoding (BPE)。与将所有学习到的合并标记暴露给下游模型的标准 BPE 不同,Pruned BPE 会识别并将低曝光标记指定为仅内部合并节点。此方法将其词汇槽重新分配给更常用的标记,从而实现更高效的可见词汇表。实验表明,在英语和中文语料库上,Pruned BPE 与 Standard BPE 相比,始终能缩短编码长度,在不影响语言模…