languages of Africa
PulseAugur coverage of languages of Africa — every cluster mentioning languages of Africa across labs, papers, and developer communities, ranked by signal.
- 2026-08-10 funding Microsoft, Gates Foundation, and Google.org are funding 26 projects to develop AI for over 50 African languages. 来源
3 天有情绪数据
-
新的SLM模型提升19种非洲语言的机器翻译能力
一项新的研究论文介绍TranslatePsy-AfriSLM,这是一套旨在改善19种撒哈拉以南非洲语言机器翻译的资源。该项目包括精选的平行数据、为非洲语言量身定制的合成数据,以及一系列微调后的小型语言模型(SLM)。研究强调,过滤训练数据可以去除高达96%的标记而不会损失质量,并且过滤后的合成数据提供了卓越的质量效率。最终的TranslatePsy-AfriSLM模型在参数数量显著减少的情况下,表现优于TranslateGemma-2…
-
AI模型在非洲语言方面表现不佳,安全信号损失90%
在用非洲语言进行测试时,AI模型在安全对齐方面表现出显著的性能下降,保留的信号不到英语安全信号的10%。由于缺乏足够的模型安全护栏,这种缺陷使这些语言的使用者面临风险。这个问题突显了当前AI安全研究和部署中存在的关键差距,尤其是在语言多样性方面。
-
微软、盖茨基金会、谷歌资助50多种非洲语言AI项目
一项新计划旨在为50多种非洲语言开发人工智能技术,资金来自微软、盖茨基金会和Google.org。这些项目将专注于医疗保健、农业和教育等关键领域。预计该举措将惠及非洲大陆约5亿人口。
-
新的AfriNLLB模型为15种非洲语言提供高效翻译
研究人员开发了AfriNLLB,这是一套专为非洲语言设计的轻量级翻译模型。这些模型源自NLLB-200 600M架构,通过层剪枝和量化进行压缩。AfriNLLB模型在精心策划的非洲语言平行语料库上进行了微调,旨在为资源受限的环境提供高效的翻译能力。评估表明,AfriNLLB模型在实现与基线模型相当的性能的同时,翻译速度显著提高。
-
DONDO:为 27 种非洲语言发布开源 ASR 模型
研究人员推出了 DONDO,这是一系列专为非洲语言设计的开源自动语音识别 (ASR) 模型。这些模型基于 w2v-BERT 2.0 架构构建,包含 21 个单语版本和 5 个多语版本,覆盖六个国家的 27 种语言变体。这些模型使用宗教文本进行了微调,并采用了一种新颖的语言条件机制,在多语种家族的平均词错误率方面达到了 10-13%。所有 DONDO 模型均可在 Hugging Face 上以 Apache-2.0 许可证提供,可免费用…
-
跨语言迁移学习在低资源ASR方面效果不一
研究人员探索了跨语言迁移学习以改进低资源语言的自动语音识别(ASR)。一项研究成功利用僧伽罗语提升了迪维希语ASR,通过持续预训练和微调实现了12.89%的词错误率(WER)。相比之下,另一项研究发现,对于大规模多语言ASR模型,在相关辅助语言上进行预适应并未显著提升低资源非洲语言的性能,表明在这种情况下,语言相关性本身可能不足够。
-
非洲语言在前沿大型语言模型中面临严重分词惩罚
一项新的研究论文揭示了前沿大型语言模型中存在显著的“非洲语言税”,其中分词器为非洲语言分配的子词数量远超英语。这导致这些语言的使用者面临更高的推理成本、增加的延迟以及缩小的有效上下文窗口。该研究衡量了这种惩罚在20种非洲语言中的表现,发现使用埃塞俄比亚文字和N'Ko文字的语言惩罚尤为严重,某些情况下的成本倍增高达8.9倍。虽然Gemma 4等较新的分词器有所改进,但并未消除这种惩罚,凸显了大型语言模型基础设施中编码的数字鸿沟。
-
新基准测试大语言模型在非洲语言中的安全性
研究人员开发了TukaBench,一个旨在评估大语言模型(LLMs)在七种非洲语言中安全性的新基准。该基准超越了简单的翻译,整合了文化适应性提示、经过GPT-5.2验证的人工策划提示以及代码转换提示。初步研究结果表明,与英语相比,LLMs拒绝非洲语言提示的可能性较低,而具有文化特异性的提示拒绝率最低。研究还强调了LLMs在这些低资源语言中作为裁判时的理解能力和可靠性挑战。
-
Google发布27种非洲语言的WAXAL数据集,AfriVoices-KE新增肯尼亚语言 · 跟踪2个来源
Google Research发布了WAXAL,这是一个涵盖27种非洲语言的大规模开放语音数据集,旨在弥合语音技术领域的数字鸿沟。该数据集包含约1846小时的ASR数据和超过565小时的TTS数据,是通过与非洲学术和社区组织合作收集的。同时,一个名为AfriVoices-KE的新数据集也被发布,其中包含约3000小时的五种肯尼亚语言的音频,混合了脚本化和自发性语音。这两项举措都旨在促进包容性语音技术的发展和保护语言遗产。