PulseAugur
实时 09:51:00
实体 Whisper-small

Whisper-small

PulseAugur coverage of Whisper-small — every cluster mentioning Whisper-small across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 5
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. RESEARCH · CL_210255 ·

    Whisper语音识别模型适配多语言医疗用途

    研究人员分析了多语言医疗适配如何影响Whisper模型的内部表征。该研究比较了不同Whisper模型尺寸的各种微调策略,发现微调显著提高了MedASR的性能。在特定的诊断场景下,Whisper-Medium实现了最低的英语词错误率(WER),而Whisper-Large-v3实现了最低的德语WER。分析表明,英语医疗微调引起了编码器表征最显著的变化,而多语言延续在很大程度上保持了这些适配。

  2. TOOL · CL_140740 ·

    Apple的SpeechAnalyzer API提升设备端转录速度

    Apple推出了其SpeechAnalyzer API,专为设备端英语语音转录而设计。该新API利用Apple Neural Engine在速度和准确性方面取得了显著改进,据报道比Whisper Small快三倍,词错误率(WER)为2.12%。尽管取得了这些进展,该API目前的局限性包括仅支持英语以及缺乏说话人分离功能。

  3. TOOL · CL_104723 ·

    ASR系统评估用于低资源非洲语言文本语料库

    研究人员评估了自动语音识别(ASR)系统在为低资源非洲语言(特别是芳语和豪萨语)创建文本语料库方面的有效性。通过在芳语数据上微调MMS-300M模型,他们显著降低了词错误率(WER)。对于豪萨语,则使用了现有的微调Whisper-Small模型。虽然ASR流程对豪萨语显示出潜力,但芳语转录的质量表明需要改进模型或进行后处理。

  4. TOOL · CL_74410 ·

    新攻击通过操纵语音特征而非波形来针对ASR

    研究人员开发了一种新的自动语音识别(ASR)系统对抗攻击方法,该方法在特征空间而非直接在音频波形上操作。这种被称为“干净参考特征-声码器攻击”的方法旨在提高对黑盒ASR模型的迁移性,并绕过针对波形扰动的防御。通过操纵自监督学习表示并通过声码器进行重构,该攻击在各种ASR模型上显著提高了词错误率(WER),凸显了当前鲁棒性评估中的一个漏洞。

  5. RESEARCH · CL_76814 ·

    新方法提升语码转换语音识别能力

    研究人员开发了一种新的对比训练方法,以改进语码转换的自动语音识别,语码转换是指在单次话语中交替使用不同语言。该方法识别关键的语码转换点,并使用大型语言模型生成合理的“近失”假设。使用这种技术对Whisper-small模型进行微调,在特定的语码转换数据集上显示出超过2%的错误率降低。

  6. TOOL · CL_44843 ·

    量化研究使更小、更准确的Whisper-small ASR成为可能

    一篇新发布的arXiv研究论文评估了用于Whisper-small自动语音识别模型的各种训练后量化(PTQ)技术。该研究测试了PyTorch、Optimum-Quanto、HQQ和bitsandbytes等库,发现使用Quanto的动态int8量化在压缩和准确性之间取得了最佳平衡。该方法将模型大小减少了57%,同时在LibriSpeech数据集上略微提高了词错误率,使得Whisper-small更容易部署在资源受限的设备上。