实体
low-resource languages
low-resource languages
PulseAugur coverage of low-resource languages — every cluster mentioning low-resource languages across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
新研究探讨大型语言模型在不同语言和任务中的不确定性估计 · 跟踪 4 个来源
研究人员正在探索提高大型语言模型 (LLM) 在各种语言和任务中的不确定性估计的方法。一项研究发现,即使问题是低资源语言,提示 LLM 用英语进行推理也能显著提高不确定性估计性能。另一篇论文提出了一个框架,将 LLM 的不确定性分解为输入歧义、知识差距和解码随机性,从而为审计可靠性提供更细致的理解。此外,一种新方法使用知识蒸馏来创建高效的、单通道的 LLM 进行不确定性估计,其性能与计算密集型方法相当。
-
研究发现:多样例上下文学习可提升低资源语言翻译能力
研究人员对低资源语言的机器翻译进行了多样例上下文学习(ICL)的实证研究。研究结果表明,增加ICL中的示例数量通常能提高性能。研究还表明,使用基于BM25的检索来选择示例可以显著提高数据效率,从而用更少的示例获得可比的结果。此外,研究表明ICL与微调技术结合使用可以带来额外的好处。
-
Whisper ASR 模型针对低资源语言进行改进
研究人员在 Whisper ASR 模型中发现了解码器不一致性,这会导致德拉威语和其他低资源语言的词错误率更高。他们发现这些语言的单词更长、词汇多样性更大、重复性更少,从而导致稀疏的 token 分布和替换错误。为解决此问题,该论文提出了两种解码器增强方法:加权注意力(Weighted-Attention)以平衡语言和声学线索,以及自适应(Self-Conditioning)通过重新注入中间预测来提高 token 的一致性。这些方法在…