PulseAugur
中
实时 06:59:21
实体 Belebele

Belebele

PulseAugur coverage of Belebele — every cluster mentioning Belebele across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
6
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
5
90 天内 5
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 6 条
  1. COMMENTARY · CL_199359 ·

    LLM 语言支持声明与官方承诺不符

    大型语言模型(LLM)通常声称支持一百多种语言,因为它们的预训练数据非常广泛,但这种流畅性并不等同于官方支持或经过验证的基准性能。Meta (Llama 3.1)、Cohere (Command R)、阿里巴巴 (Qwen) 和 OpenAI (GPT-4) 等供应商通常在其模型卡上列出的官方支持语言要少得多,通常在八到三十种之间。此官方列表代表了对评估性能的承诺,将其与仅存在于训练数据中的语言或已发布基准结果的语言区分开来,而后者通…

  2. TOOL · CL_197463 ·

    研究发现:人工智能基准测试覆盖的语言不到世界语言的3%

    当前人工智能语言模型的基准测试严重低估了世界语言多样性,最广泛的基准测试仅覆盖了约7000种现存语言中的2.9%。即使是最全面的文本基准测试FLORES-200,也只包含200种语言,而像MMLU这样被广泛引用的基准测试则专注于单一语言——英语。这种有限的覆盖意味着,虽然模型可能在几十种语言的翻译能力上有所表现,但它们在推理、安全或指令遵循等复杂任务上的表现,在绝大多数世界语言中却很少得到评估。

  3. RESEARCH · CL_167424 ·

    由于以英语为中心的训练,印度语言在大型语言模型中面临 8 倍的“分词器税”

    一篇新的研究论文强调了印度语言在通过大型语言模型处理时面临的重大劣势,这是由于子词分词造成的。这些主要在英语数据上训练的分词器,导致印度语言平均面临 8.0 倍的“分词器税”,极大地缩减了其有效上下文窗口。研究确定字节对合并失败是主要原因,但也表明多语言分词器可以显著降低这种税负,表明该问题可以通过更好的分词器设计来解决。

  4. RESEARCH · CL_105152 ·

    LangMAP分词在不改变词汇表的情况下适应多语言模型

    研究人员开发了LangMAP,一种新颖的语言自适应分词方法,将UnigramLM算法扩展到多语言环境。该方法允许从单一共享词汇表中进行特定语言的分词,从而在不改变词汇表的情况下适应预训练模型。LangMAP在编程语言的形态边界和抽象语法树叶子边界上表现出更好的对齐,尽管其在知识相关任务上的益处喜忧参半。

  5. TOOL · CL_58715 ·

    多语言语码转换提升了四种语言的LLM性能

    研究人员探讨了多语言语码转换数据(CSD)对四种语言(英语、日语、韩语和中文)的大型语言模型(LLMs)的影响。他们的实验表明,在句子层面引入多语言CSD能够持续提升多语言理解任务的平均性能,将语码转换的益处扩展到双语场景之外。

  6. RESEARCH · CL_55944 ·

    新研究解决了混合专家模型中的多语言适应问题

    两篇新研究论文探讨了混合专家(MoE)模型在多语言任务中的适应性。一篇论文分析了语言专业化如何在持续预训练期间在MoE模型中出现,发现最终层会发展出特定语言的路由,并提出了一种仅更新少量参数的高效适应策略。另一篇论文介绍了RA-MoE,一个用于对齐跨语言路由模式以提高非英语下游任务性能的微调框架,证明了其在标准微调方法上的持续收益。