Roman Urdu
PulseAugur coverage of Roman Urdu — every cluster mentioning Roman Urdu across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
PEFT 将罗马乌尔都语中大型语言模型的仇恨言论检测 F1 分数提升至 93% 以上
一篇新研究论文探讨了参数高效微调 (PEFT) 方法,特别是低秩自适应 (LoRA),在罗马乌尔都语仇恨言论检测中的有效性。研究发现,虽然在 Mistral、LLaMA、Falcon 和 BERT 等模型上进行零样本推理取得了中等结果(F1 分数 0.56),但使用 PEFT 进行微调可将性能显著提高到 0.93 以上的 F1 分数。这种方法展示了强大的计算效率,使其成为处理低资源语言的可行解决方案。
-
新方法ROMEVA改进罗马乌尔都语语言模型适应性
一篇新研究论文介绍了一种名为ROMEVA的方法,用于扩展多语言语言模型(如mBERT)的词汇表,以更好地处理像罗马乌尔都语这样形态不一致的语言。罗马乌尔都语不一致的拼写导致显著的子词碎片化,平均每个词元(token)有1.50个子词。ROMEVA结合了子词初始化和PCA引导的锚定损失,以在词汇扩展期间稳定词嵌入。在罗马乌尔都语语料库上的实验表明,尽管ROMEVA最有效地保持了词嵌入空间,但朴素的微调在下游情感分类任务上产生了更好的性能…
-
新方法ROMEVA改进罗马乌尔都语语言模型词汇
研究人员开发了ROMEVA,一种用于扩展多语言语言模型(如mBERT)词汇量的新方法,以更好地处理拼写不一致的语言,例如罗马乌尔都语。该方法结合了子词初始化和PCA引导的锚定损失,以在词汇扩展过程中稳定嵌入。虽然ROMEVA有效地保留了预训练的嵌入空间,但在下游情感分类任务中,直接在罗马乌尔都语语料库上对模型进行微调可获得更优越的性能,这表明对于形态不一致的语言来说,严格的嵌入保留可能并非总是最优的。