实体
Unigram LM
Unigram LM
PulseAugur coverage of Unigram LM — every cluster mentioning Unigram LM across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
BPE 对比 Unigram-LM:分词算法为化学 SMILES 创建了不同的词汇表
一篇新的研究论文探讨了两种常见的分词方法——字节对编码 (BPE) 和 Unigram-LM——在应用于化学 SMILES 字符串时产生的差异。研究发现,这些算法会产生显著不同的词汇表,其中 Unigram-LM 将分子分割成比 BPE 更多的 token。这表明子词算法的选择对于化学语言模型来说是一个关键的建模决策,而不是一个默认设置。
-
新基准QuechuaTok凸显黏着语分词的局限性
一个名为QuechuaTok的新基准已被开发出来,用于评估黏着语、低资源语言的分词策略。标准的指标如生育率(fertility rate)是不够的,因此QuechuaTok引入了词缀边界准确性(MorphAcc)。该研究在南部盖丘亚语上比较了BPE、Unigram LM、WordPiece以及一个具有形态感知能力的PRPE分词器,发现PRPE比优先考虑表面词形(surface word forms)的BPE取得了显著更高的MorphAcc。