Twi
PulseAugur coverage of Twi — every cluster mentioning Twi across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新数据集MGhana-ST面向加纳低资源语言
研究人员推出了MGhana-ST,一个专为四种低资源加纳语言(Ga、Twi、Ewe和Fante)设计的语音翻译数据集。该数据集包含配对的音频和英语翻译,并标注了口头和非口头事件,旨在推动非洲语言语音技术的研究。使用Whisper-small模型的实验表明,在数据稀缺的情况下,扁平化多语言训练并未使所有语言受益,与单语言训练相比,一些语言的性能有所下降。
-
加纳自然语言处理研究偏重Twi语,忽视70多种语言
对加纳语言自然语言处理(NLP)研究的一项新系统性回顾显示,存在显著的不平衡,以Twi语为中心的努力占据主导地位,而70多种其他本土语言则在很大程度上未得到解决。对17,000多篇出版物的分析突显了资源严重短缺、数据集和模型共享不一致以及对共享基础设施的需求。该论文提出了一项路线图,以应对区域限制、方言变体和非标准化拼写法,为类似的低资源语言环境提供了模型。
-
研究发现:大型语言模型(LLM)的安全防护未能跨越低资源语言
一篇新发表在arXiv上的研究论文强调了大型语言模型(LLM)跨语言安全性的显著局限性。该研究聚焦于四种非洲语言——Twi语、豪萨语、阿姆哈拉语和斯瓦希里语,发现为英语开发的安全性对齐方法并未有效迁移到这些低资源语言中。研究人员使用了一个名为LoDNA的新数据集和一个潜在几何框架,发现有害提示保留的英语拒绝信号不到10%,这表明当前的跨语言安全措施是肤浅的。
-
研究人员在有限硬件上微调 NLLB 以支持 Twi
一位研究人员详细介绍了他们在简陋的 6GB 显存设置上微调 NLLB 模型以支持 Twi 语言的经验。该过程涉及克服与规模化限制和确保人类对齐相关的挑战。最终模型被呈现为一个进行中的工作,而不是一个最终的、完美的解决方案。