LibriSpeech
PulseAugur coverage of LibriSpeech — every cluster mentioning LibriSpeech across labs, papers, and developer communities, ranked by signal.
6 天有情绪数据
-
Hugging Face 量化 ASR 基准优化,发现模型会复现错误
Hugging Face 的研究人员开发了新的方法来量化语音识别模型中的“基准优化”或“benchmaxxing”。他们的研究评估了 11 个开源 ASR 模型,发现几个高分系统会复现错误的基准转录,即使音频与转录内容相矛盾。这表明模型可能通过声学线索学习识别特定基准,而不是准确地转录语音,从而导致性能得分虚高。
-
CPU 语音克隆基准测试:Pocket TTS、Kokoro、Audio8、XTTS v2 对比
一项实际基准测试在 CPU 性能上评估了四种语音克隆模型(Pocket TTS、Kokoro、Audio88 & Yassin 和 XTTS v2)。评估重点关注说话人相似度、自然度、清晰度和延迟,使用了具有不同说话人和口音的 VCTK 数据集。研究发现,虽然 XTTS v2 和 Audio88 & Yassin 是真正的零样本克隆模型,但 Kokoro 在自然度方面表现更好,而 Pocket TTS 和 Kokoro 可作为 CPU…
-
音频模型研究详解计算-性能权衡
一篇新研究论文探讨了音频模型计算资源的最佳分配,重点关注自动语音识别(ASR)和语音情感识别(SER)。该研究提出了一个分析模型大小、输入长度和表示分辨率的框架,以在固定的计算预算下最大化性能。在LibriSpeech和CREMA-D数据集上的实验表明,增加模型大小会带来收益递减,SER的最佳音频时长约为4秒,降低编码器令牌分辨率具有成本效益。
-
CuteTTS系统通过连续自回归建模增强语音合成
研究人员开发了CuteTTS,一个新颖的文本到语音系统,旨在实现高效高质量的语音合成。该系统利用变分自编码器潜在变量和块级自回归的连续自回归建模,以平衡保真度和低延迟推理。通过一种称为引导步蒸馏的技术,CuteTTS显著降低了延迟并提高了实时因子,同时保持了与基础模型相当的客观和主观质量。
-
新的LILAC编解码器实现了幂等的音频令牌化
研究人员开发了LILAC,这是一种新颖的神经语音编解码器,旨在实现幂等性,这意味着它可以解码和重新编码音频而不会改变原始令牌流。这与现有编解码器相比是一个重大改进,现有编解码器在这些过程中通常会修改大部分令牌。LILAC保持了具有竞争力的音频质量,在0.75 kbit/s的低比特率下运行时,其UTMOS得分可与最先进的编解码器相媲美。
-
新的潜在 Softmax 提高了多语言自动语音识别的数据效率
研究人员开发了一种名为潜在 Softmax 的新输出层,用于多语言自动语音识别 (ASR) 系统。该方法旨在通过更好地处理音调语言和非音调语言之间不同的监督粒度来提高数据效率。实验表明,潜在 Softmax 降低了音素错误率,并为音素到字素转换等下游任务带来了持续的词错误率提升。
-
KRAFTON发布双语语音模型A.X K2 Raon-Speech
KRAFTON发布了A.X K2 Raon-Speech,一个拥有212亿总参数和35亿活跃参数的双语(英语/韩语)语音语言模型。该多模态模型集成了SK Telecom的A.X K2 Light 20B-A3B的文本主干,以及KRAFTON AI独立开发的语音编码器和神经音频编解码器模块。该模型在语音识别、语音合成和问答等多种语音任务中表现出色,在300亿参数以下的公开可用模型中,其韩语和英语均位列前茅。
-
New diffusion model offers parallel speech transcription
研究人员开发了一种新颖的自动语音识别方法,使用冻结的离散扩散语言模型,这与传统的自回归解码器不同。这种新方法在几个去噪步骤中并行地精炼整个文本记录。该模型是DiffusionGemma的音频原生接口,它使用冻结的Whisper编码器来获取声学特征,并在LibriSpeech test-clean基准测试上实现了6.6%的词错误率,大约在八个并行步骤中处理语音。
-
新的COALA框架通过上下文偏置提升语音识别能力
研究人员开发了COALA,一个旨在通过整合外部知识来改进自动语音识别(ASR)系统的新型框架。COALA通过将潜在表示映射到判别空间来增强语音增强语言模型(SLM),从而能够精确量化音频片段与候选实体的匹配程度。该方法解决了SLM上下文窗口的局限性,并解决了多目标发音中的训练崩溃问题,在LibriSpeech基准测试中展示了卓越的上下文偏置性能。
-
Apple 和 Cohere 通过专用高效模型推进 ASR
Apple 的机器学习研究团队开发了一种使用紧凑型 seq2seq 模型进行自动语音识别 (ASR) 错误纠正的新方法。这些模型在真实和合成 ASR 错误上进行训练,在效率和准确性方面,尤其是在低错误场景下,显著优于大型语言模型 (LLM)。与此同时,Cohere 推出了 Transcribe,一个拥有 20 亿参数的 ASR 模型,据报道其在速度和精度方面,尤其是在阿拉伯语方言方面,超越了 Whisper Large V3。
-
用户寻求帮助实现Calm TTS论文,面临语音克隆问题
一位用户正在寻求有关实现研究论文中描述的Calm文本到语音模型的帮助。他们在复制模型性能方面遇到了困难,在生成有意义的文本和实现准确的语音克隆方面遇到了问题。用户尝试了各种技术,包括计划采样和调整数据条件,但面临诸如梯度爆炸以及文本质量与语音保真度之间的权衡等挑战。他们正在寻求关于如何进行的建议,是重新审视论文、增加数据集大小,还是解决潜在的系统设计缺陷。
-
kandinskylab发布KVAE-Audio,一款高保真音频自编码器
kandinskylab发布了KVAE-Audio,一款新的连续全频带音频自编码器。该模型能有效地将原始音频波形压缩成紧凑的潜在表示,并以高保真度重建语音、音乐和通用声音。它被设计用作生成模型的潜在空间,内部测试表明,当KVAE-Audio集成到流程中时,文本到音频生成质量有所提高。
-
新型神经说话人分割模型在低资源尼泊尔-印地语语音上表现优异
研究人员开发了一种新的说话人分割方法,即在音频录音中识别谁在何时说话,特别针对尼泊尔-印地语等低资源语言。他们使用了一个包含英语、多样化说话人录音以及新收集的尼泊尔语和印地语音频的多语言数据集,训练了两种神经网络架构:EEND-EDA 和 DiaPer。利用基于 Perceiver 的吸引子(attractors)的 DiaPer 模型表现出卓越的性能,在尼泊尔-印地语测试集上实现了比 EEND-EDA 模型显著更低的说话人分割错误率…
-
Hugging Face 推出 FFASR 排行榜,用于真实世界 ASR 基准测试
Hugging Face 和 Treble Technologies 推出了 FFASR 排行榜,这是一个开放的、社区驱动的基准测试,用于评估在真实远场声学条件下自动语音识别 (ASR) 模型的性能。这个新的排行榜旨在弥合干净语音基准测试性能与真实世界部署之间存在的显著差距,在真实世界部署中,混响、背景噪音和麦克风距离通常会降低准确性。FFASR 排行榜采用混合模拟方法,并经过真实世界测量验证,以评估模型在各种嘈杂和混响环境中的性能,…
-
新的自动语音识别方法InterAligner提高了训练稳定性和减少了错误
研究人员开发了一种名为InterAligner的新方法,以提高基于对齐器-编码器的自动语音识别(ASR)模型的训练稳定性和性能。该方法引入了一个中间对齐器目标和一个中间CTC损失,使得对齐过程能够在模型层之间渐进地形成,而不是突然发生。在LibriSpeech数据集上使用17层Conformer进行测试时,InterAligner在test-clean/other上的词错误率(WER)分别为3.1%/5.6%,优于以前的方法,尤其是在…
-
新研究揭示 CTC 在语音识别中的局限性,强调语言模型的好处
一篇新的研究论文探讨了连接主义时间分类 (CTC) 在语音识别系统中的局限性。研究发现,CTC 的内部评分方法难以超越基本的贪婪解码来提高准确性,并且随着考虑的假设增多,性能会显著下降。这种局限性源于“Oracle Gap”,即声学信息耗尽,阻碍了语言恢复。然而,结合外部语言模型(如 RoBERTa)可以有效地弥合这一差距,从而在各种架构和数据集上显著提高词错误率。
-
新研究通过合成语音、LLM优化和故障减少来应对ASR挑战
研究人员正在开发先进技术以改进自动语音识别(ASR)系统,特别是在代码转换和实时应用等挑战性场景中。一篇论文提出了一种使用合成语音的混合代码引导框架,以提高ASR性能,降低特定数据集上的错误率。另一项研究介绍了NIM4-ASR,一个高效且鲁棒的基于LLM的ASR框架,针对生产环境进行了优化,能够处理嘈杂条件并支持大规模定制。第三篇论文解决了神经编解码文本到语音模型中的灾难性故障,证明ASR自验证和蒸馏可以显著减少这些错误,从而实现更可…
-
新的NAR-MBR解码提高了语音识别的速度和准确性
研究人员开发了一种新的语音识别非自回归解码框架,称为NAR-MBR解码。该方法旨在通过并行生成输出令牌来提高语音识别的速度,克服了非自回归模型通常伴随的性能下降。通过最大化从样本中获得的预期效用,而不是直接概率,NAR-MBR解码实现了更快的处理速度,并在多个基准数据集上优于以前的非自回归方法。
-
语音模型通过参数聚类进行压缩
研究人员开发了一种无需额外数据或重新训练即可压缩语音基础模型的新方法。该方法利用k-means进行通道聚类,通过改变每层的聚类数量来探索混合稀疏性剪枝。在LibriSpeech上的实验表明,与基于幅值的剪枝相比,在HuBERT-large和Whisper-large-v3等模型上,即使在相当高的稀疏度下,词错误率(WER)也显著降低。
-
新模型使用连续空间进行语音识别和翻译
研究人员推出了一种名为ELF-S2T的新型语音转文本系统方法,该系统在连续潜在空间而非离散文本标记中运行。该模型基于嵌入式语言流(ELF)骨干,将音频条件和流匹配去噪用于语音识别和翻译任务。在标准数据集上的实验表明其性能具有竞争力,并揭示了识别和翻译中的错误源于此连续潜在空间中相似的混淆。