PulseAugur
实时 15:28:20
实体 UnigramLM

UnigramLM

PulseAugur coverage of UnigramLM — every cluster mentioning UnigramLM across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. TOOL · CL_193754 ·

    分词被证明是NP完全和APX难的,即使对于二元字母表

    一篇新的研究论文表明,分词(自然语言处理中的一个基本过程)即使在有界字母表上也是计算上不可行的。该研究证明,无论是自顶向下还是直接分词方法,即使仅限于二元字母表,都是NP完全和APX难的。这些发现表明,分词的固有难度并非源于复杂的构造或大的字母表,而是一个基本障碍,解释了BPE和UnigramLM等当前算法的启发式性质,并强调了未来研究中对近似算法的需求。

  2. TOOL · CL_154365 ·

    新的分词器方法改进了大型语言模型中跨语言同形异义词的处理

    研究人员发现多语言语言模型存在一个局限性,即共享的子词词汇表可能导致相同的表面形式在不同语言中被过于统一地对待,即使它们的含义不同。他们提出了一种使用语言线索的分词器级别的干预方法,以改进对跨语言同形异义词和假朋友的处理。该方法包括在构建词汇表时,用特定语言的字符替换共享词汇单词的初始字符。虽然内在分析表明这种干预有助于 SaGe 分词器更强地发散,但下游机器翻译实验仅取得了适度的改进,特别是对于 BPE,但并非在所有语言中都一致。

  3. RESEARCH · CL_105152 ·

    LangMAP分词在不改变词汇表的情况下适应多语言模型

    研究人员开发了LangMAP,一种新颖的语言自适应分词方法,将UnigramLM算法扩展到多语言环境。该方法允许从单一共享词汇表中进行特定语言的分词,从而在不改变词汇表的情况下适应预训练模型。LangMAP在编程语言的形态边界和抽象语法树叶子边界上表现出更好的对齐,尽管其在知识相关任务上的益处喜忧参半。

  4. RESEARCH · CL_43970 ·

    新的ToaST分词器将词元数量减少了11%以上

    研究人员开发了一种名为基于分裂树的分词(ToaST)的新子词分词方法。该方法通过将文本递归地分裂成二叉树并基于整数规划松弛选择词汇来优化压缩。与BPE和WordPiece等现有方法相比,ToaST在词元数量上减少了11%,并在训练1.5B参数语言模型方面取得了更好的性能。