PulseAugur
中
实时 03:30:17
实体 Whisper-medium

Whisper-medium

PulseAugur coverage of Whisper-medium — every cluster mentioning Whisper-medium across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 7
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 7 条
  1. RESEARCH · CL_254605 ·

    新方法通过编码器选择和对比解码增强大型音频语言模型 · 跟踪 2 个来源

    研究人员开发了两种新方法来提高大型音频语言模型 (LALM) 的性能。第一种方法 CUES(相关性引导编码器选择)使用轻量级启发式方法,通过估计编码器的互补性(通过性能相关性)来选择最佳编码器,在 XARES-LLM 等基准测试中取得了显著的提升。第二种方法对比解码 (CD) 系统地评估了不同的 CD 策略,确定了音频感知解码和音频对比解码最为有效。该方法主要纠正与音频忽略或不确定性驱动的猜测相关的错误,其收益与模型的基线错误特征密切相关。

  2. TOOL · CL_216059 ·

    语音到SFT管道消融研究揭示数据质量提升不总能促进下游性能

    一篇新发表在arXiv上的研究论文详细介绍了一个语音到SFT管道的因子消融研究,调查了不同精炼阶段对数据质量和下游模型性能的影响。研究发现,虽然QA数据质量的提高持续提高了LLM评估者的得分,但这些收益并未均匀地转化为下游选择题QA基准测试的更好性能。改进的积极迁移集中在与家庭领域对齐的配对上,这表明SFT数据组成与MCQA探针的性质之间可能存在格式不匹配。

  3. RESEARCH · CL_210255 ·

    Whisper语音识别模型适配多语言医疗用途

    研究人员分析了多语言医疗适配如何影响Whisper模型的内部表征。该研究比较了不同Whisper模型尺寸的各种微调策略,发现微调显著提高了MedASR的性能。在特定的诊断场景下,Whisper-Medium实现了最低的英语词错误率(WER),而Whisper-Large-v3实现了最低的德语WER。分析表明,英语医疗微调引起了编码器表征最显著的变化,而多语言延续在很大程度上保持了这些适配。

  4. TOOL · CL_200119 ·

    新的CASA系统使用大语言模型进行可解释的语音评估

    研究人员开发了CASA,一个使用Whisper-medium和Qwen3.5-2B大语言模型组合的新型自动语音评估系统。CASA通过分离声学和内容对预测的贡献,实现了最先进的性能和更高的可解释性。该系统在Speak & Improve Corpus 2025上展示了0.358的均方根误差,优于先前的方法,同时使用了更少的推理参数。CASA的架构设计易于适应其他语音评估数据集,并包含手工制作的流畅性特征。

  5. TOOL · CL_200003 ·

    新基准比较了尼泊尔ASR的多语言模型

    一项新研究使用标准化的微调协议,对尼泊尔自动语音识别(ASR)的六个多语言预训练模型进行了基准测试。研究发现,Whisper-Large-v3-Turbo 和 IndicWav2Vec 的表现相当,表明预训练中的语系接近性对于尼泊尔ASR可以与单纯的规模一样有效。研究还强调,与Whisper等自回归模型相比,CTC解码器在相似的准确度水平下提供了显著更快的性能,因此对于有延迟限制的应用来说是更可取的。这项工作为尼泊尔ASR提供了第一个…

  6. RESEARCH · CL_99707 ·

    零样本语音克隆增强构音障碍ASR模型训练

    研究人员探索了零样本语音克隆作为一种方法,用于增强在构音障碍语音上训练的自动语音识别(ASR)系统的数据集。通过使用Higgs Audio V2克隆TORGO数据集中的说话人,他们能够微调Whisper-medium模型。该方法实现了26.00%的词错误率(WER),与在真实或混合数据上训练的模型相比具有竞争力,并且在对中度至重度构音障碍的说话人进行真实数据训练方面表现出色。研究结果表明,零样本克隆为构音障碍ASR中的数据稀缺问题提供…

  7. TOOL · CL_58672 ·

    ASR模型在荷兰儿童语音上的评估,Whisper-medium表现最佳

    一项新近发表在arXiv上的研究评估了包括Whisper、Parakeet和Wav2Vec2在内的九个最先进的自动语音识别(ASR)模型在荷兰儿童语音数据集上的表现。微调后的Whisper-medium模型展现了最佳的整体性能,在JASMIN数据集上的词错误率(WER)为5.54%,在更具挑战性的DART数据集上为70.37%。研究人员还开发了一种自动识别发音准确且置信度高的语句的方法,减少了手动验证的需求,并实现了数据中很大一部分的自动转录。