Belebele
PulseAugur coverage of Belebele — every cluster mentioning Belebele across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
由于以英语为中心的训练,印度语言在大型语言模型中面临 8 倍的“分词器税”
一篇新的研究论文强调了印度语言在通过大型语言模型处理时面临的重大劣势,这是由于子词分词造成的。这些主要在英语数据上训练的分词器,导致印度语言平均面临 8.0 倍的“分词器税”,极大地缩减了其有效上下文窗口。研究确定字节对合并失败是主要原因,但也表明多语言分词器可以显著降低这种税负,表明该问题可以通过更好的分词器设计来解决。
-
LangMAP分词在不改变词汇表的情况下适应多语言模型
研究人员开发了LangMAP,一种新颖的语言自适应分词方法,将UnigramLM算法扩展到多语言环境。该方法允许从单一共享词汇表中进行特定语言的分词,从而在不改变词汇表的情况下适应预训练模型。LangMAP在编程语言的形态边界和抽象语法树叶子边界上表现出更好的对齐,尽管其在知识相关任务上的益处喜忧参半。
-
多语言语码转换提升了四种语言的LLM性能
研究人员探讨了多语言语码转换数据(CSD)对四种语言(英语、日语、韩语和中文)的大型语言模型(LLMs)的影响。他们的实验表明,在句子层面引入多语言CSD能够持续提升多语言理解任务的平均性能,将语码转换的益处扩展到双语场景之外。
-
新研究解决了混合专家模型中的多语言适应问题
两篇新研究论文探讨了混合专家(MoE)模型在多语言任务中的适应性。一篇论文分析了语言专业化如何在持续预训练期间在MoE模型中出现,发现最终层会发展出特定语言的路由,并提出了一种仅更新少量参数的高效适应策略。另一篇论文介绍了RA-MoE,一个用于对齐跨语言路由模式以提高非英语下游任务性能的微调框架,证明了其在标准微调方法上的持续收益。