low-resource languages
PulseAugur coverage of low-resource languages — every cluster mentioning low-resource languages across labs, papers, and developer communities, ranked by signal.
-
新框架提升低资源语言的OCR识别能力
研究人员开发了一个名为PSMC的新框架,以改进低资源语言的光学字符识别(OCR)。传统的微调方法在数据有限的情况下难以奏效,而PSMC通过专门化和合并来自高资源基础模型的专家,利用了跨脚本的迁移效应。这种方法在10种印度语言的单词识别率上平均提高了2%,为视觉语言模型开发展示了一条更具包容性的途径。
-
新研究探讨大型语言模型在不同语言和任务中的不确定性估计 · 跟踪 4 个来源
研究人员正在探索提高大型语言模型 (LLM) 在各种语言和任务中的不确定性估计的方法。一项研究发现,即使问题是低资源语言,提示 LLM 用英语进行推理也能显著提高不确定性估计性能。另一篇论文提出了一个框架,将 LLM 的不确定性分解为输入歧义、知识差距和解码随机性,从而为审计可靠性提供更细致的理解。此外,一种新方法使用知识蒸馏来创建高效的、单通道的 LLM 进行不确定性估计,其性能与计算密集型方法相当。
-
研究发现:多样例上下文学习可提升低资源语言翻译能力
研究人员对低资源语言的机器翻译进行了多样例上下文学习(ICL)的实证研究。研究结果表明,增加ICL中的示例数量通常能提高性能。研究还表明,使用基于BM25的检索来选择示例可以显著提高数据效率,从而用更少的示例获得可比的结果。此外,研究表明ICL与微调技术结合使用可以带来额外的好处。
-
Whisper ASR 模型针对低资源语言进行改进
研究人员在 Whisper ASR 模型中发现了解码器不一致性,这会导致德拉威语和其他低资源语言的词错误率更高。他们发现这些语言的单词更长、词汇多样性更大、重复性更少,从而导致稀疏的 token 分布和替换错误。为解决此问题,该论文提出了两种解码器增强方法:加权注意力(Weighted-Attention)以平衡语言和声学线索,以及自适应(Self-Conditioning)通过重新注入中间预测来提高 token 的一致性。这些方法在…