Whisper-medium
PulseAugur coverage of Whisper-medium — every cluster mentioning Whisper-medium across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的CASA系统使用大语言模型进行可解释的语音评估
研究人员开发了CASA,一个使用Whisper-medium和Qwen3.5-2B大语言模型组合的新型自动语音评估系统。CASA通过分离声学和内容对预测的贡献,实现了最先进的性能和更高的可解释性。该系统在Speak & Improve Corpus 2025上展示了0.358的均方根误差,优于先前的方法,同时使用了更少的推理参数。CASA的架构设计易于适应其他语音评估数据集,并包含手工制作的流畅性特征。
-
新基准比较了尼泊尔ASR的多语言模型
一项新研究使用标准化的微调协议,对尼泊尔自动语音识别(ASR)的六个多语言预训练模型进行了基准测试。研究发现,Whisper-Large-v3-Turbo 和 IndicWav2Vec 的表现相当,表明预训练中的语系接近性对于尼泊尔ASR可以与单纯的规模一样有效。研究还强调,与Whisper等自回归模型相比,CTC解码器在相似的准确度水平下提供了显著更快的性能,因此对于有延迟限制的应用来说是更可取的。这项工作为尼泊尔ASR提供了第一个…
-
零样本语音克隆增强构音障碍ASR模型训练
研究人员探索了零样本语音克隆作为一种方法,用于增强在构音障碍语音上训练的自动语音识别(ASR)系统的数据集。通过使用Higgs Audio V2克隆TORGO数据集中的说话人,他们能够微调Whisper-medium模型。该方法实现了26.00%的词错误率(WER),与在真实或混合数据上训练的模型相比具有竞争力,并且在对中度至重度构音障碍的说话人进行真实数据训练方面表现出色。研究结果表明,零样本克隆为构音障碍ASR中的数据稀缺问题提供…
-
ASR模型在荷兰儿童语音上的评估,Whisper-medium表现最佳
一项新近发表在arXiv上的研究评估了包括Whisper、Parakeet和Wav2Vec2在内的九个最先进的自动语音识别(ASR)模型在荷兰儿童语音数据集上的表现。微调后的Whisper-medium模型展现了最佳的整体性能,在JASMIN数据集上的词错误率(WER)为5.54%,在更具挑战性的DART数据集上为70.37%。研究人员还开发了一种自动识别发音准确且置信度高的语句的方法,减少了手动验证的需求,并实现了数据中很大一部分的自动转录。