Whisper-small
PulseAugur coverage of Whisper-small — every cluster mentioning Whisper-small across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Whisper语音识别模型适配多语言医疗用途
研究人员分析了多语言医疗适配如何影响Whisper模型的内部表征。该研究比较了不同Whisper模型尺寸的各种微调策略,发现微调显著提高了MedASR的性能。在特定的诊断场景下,Whisper-Medium实现了最低的英语词错误率(WER),而Whisper-Large-v3实现了最低的德语WER。分析表明,英语医疗微调引起了编码器表征最显著的变化,而多语言延续在很大程度上保持了这些适配。
-
Apple的SpeechAnalyzer API提升设备端转录速度
Apple推出了其SpeechAnalyzer API,专为设备端英语语音转录而设计。该新API利用Apple Neural Engine在速度和准确性方面取得了显著改进,据报道比Whisper Small快三倍,词错误率(WER)为2.12%。尽管取得了这些进展,该API目前的局限性包括仅支持英语以及缺乏说话人分离功能。
-
ASR系统评估用于低资源非洲语言文本语料库
研究人员评估了自动语音识别(ASR)系统在为低资源非洲语言(特别是芳语和豪萨语)创建文本语料库方面的有效性。通过在芳语数据上微调MMS-300M模型,他们显著降低了词错误率(WER)。对于豪萨语,则使用了现有的微调Whisper-Small模型。虽然ASR流程对豪萨语显示出潜力,但芳语转录的质量表明需要改进模型或进行后处理。
-
新攻击通过操纵语音特征而非波形来针对ASR
研究人员开发了一种新的自动语音识别(ASR)系统对抗攻击方法,该方法在特征空间而非直接在音频波形上操作。这种被称为“干净参考特征-声码器攻击”的方法旨在提高对黑盒ASR模型的迁移性,并绕过针对波形扰动的防御。通过操纵自监督学习表示并通过声码器进行重构,该攻击在各种ASR模型上显著提高了词错误率(WER),凸显了当前鲁棒性评估中的一个漏洞。
-
新方法提升语码转换语音识别能力
研究人员开发了一种新的对比训练方法,以改进语码转换的自动语音识别,语码转换是指在单次话语中交替使用不同语言。该方法识别关键的语码转换点,并使用大型语言模型生成合理的“近失”假设。使用这种技术对Whisper-small模型进行微调,在特定的语码转换数据集上显示出超过2%的错误率降低。
-
量化研究使更小、更准确的Whisper-small ASR成为可能
一篇新发布的arXiv研究论文评估了用于Whisper-small自动语音识别模型的各种训练后量化(PTQ)技术。该研究测试了PyTorch、Optimum-Quanto、HQQ和bitsandbytes等库,发现使用Quanto的动态int8量化在压缩和准确性之间取得了最佳平衡。该方法将模型大小减少了57%,同时在LibriSpeech数据集上略微提高了词错误率,使得Whisper-small更容易部署在资源受限的设备上。