Assamese
PulseAugur coverage of Assamese — every cluster mentioning Assamese across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新方法通过适配器堆叠提升低资源语言语音识别能力
研究人员开发了一种名为顺序适配器堆叠的新方法,以改进低资源语言的自动语音识别(ASR)。该技术涉及将可训练的目标语言适配器叠加在冻结的源语言适配器之上,并基于现有的多语言 ASR 模型(如 Whisper)。实验表明,即使对于阿斯图里亚斯语、阿萨姆语和科萨语等语言,仅用一小时的训练数据,该方法也显著优于完全微调,相对词错误率降低了 5-8%。
-
Whisper模型微调以实现鲁棒的阿萨姆语语音识别
研究人员开发了一个微调版本的Whisper模型,以改进阿萨姆语的自动语音识别(ASR)。该微调模型在Mozilla Common Voice 24.0-Assamese语料库上进行训练,并使用Tesla 4 GPU针对资源受限环境进行了优化,其性能显著优于零样本基线。新系统在词错误率(WER)、字符错误率(CER)、匹配错误率(MER)和词信息丢失(WIL)方面实现了大幅降低,同时在语义评估的BLEU和METEOR分数方面也有显著提高。
-
研究发现语言相似性可提升低资源ASR迁移效果
一项新的研究论文探讨了在极低资源场景下,语言相似性如何增强跨语言迁移在自动语音识别(ASR)中的作用。该研究聚焦于数据有限的澳大利亚原住民语言Warlpiri,并提出了一个结合预训练模型的声学相似性和语言学特征的框架。使用Whisper进行的实验表明,与基线模型相比,像Assamese和Hindi这样声学上和类型学上相似的语言显著降低了词错误率和字符错误率。
-
新框架审计TTS的语音学准确性
研究人员开发了一个新的框架来评估多语言文本转语音(TTS)系统,重点关注它们保留区分词义的语音学对比度的能力。平均意见分(MOS)等标准指标在此任务中不足。所提出的方法使用一个在人类语音上训练的分类器来根据特定语言的语音学模式审计TTS输出。当应用于Meta的MMS TTS系统(针对阿萨姆语)时,该框架显示某些元音被错误地发音,表明合成语音中的预期语音学与实际语音学之间存在差距。