PulseAugur
中
实时 12:34:07
实体 Whisper Large V3

Whisper Large V3

PulseAugur coverage of Whisper Large V3 — every cluster mentioning Whisper Large V3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
29
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
18
90 天内 18
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 29 条
  1. TOOL · CL_284521 ·

    新的AI框架支持口音分类的增量式扩展

    研究人员开发了AccentCL,一个新颖的英语口音分类框架,可以增量式地扩展其标签库。该系统通过使用冻结的Whisper-Large-v3编码器和具有不平衡感知的交叉熵损失来应对类别不平衡和域偏移等挑战。AccentCL还纳入了域均值对齐损失,以减轻不同训练语料库之间的分布偏移。该框架表现强劲,在一个五类任务上实现了77.1%的平衡准确率,并成功地纳入了西班牙口音和中国口音英语等新口音类别,而无需完全重新训练。

  2. TOOL · CL_257019 ·

    新模型DiaWhisper-DPO改进了临床访谈转录和角色归因

    研究人员开发了DiaWhisper-DPO,一个用于转录临床访谈并将话语归因于临床医生或患者的端到端模型。该模型使用LoRA和辅助角色头对Whisper-large-v3进行微调,并通过DiaWhisper-DPO进一步优化性能,该模型利用解码失败作为偏好优化的负面示例,而无需人工标注。该系统在DAIC-WoZ数据集上表现出显著的改进,角色准确率达到0.973,DER比级联基线降低了72%,同时在跨语言PDCH-HAMD数据集上也表现强劲。

  3. TOOL · CL_247686 ·

    Whisper模型适应改进了希腊歌曲歌词转录

    研究人员开发了一种专门针对希腊歌曲的自动歌词转录(ALT)新方法,解决了旋律和节奏变化带来的挑战。通过适应OpenAI的Whisper模型,他们实现了27.2%的词错误率,显著优于以往的方法。该研究探讨了模型规模和多任务训练的影响,发现更大的模型和特定的训练配置能提升性能,尤其是在低资源语言方面。

  4. RESEARCH · CL_245231 ·

    BuzzASR发布100多款语言专用语音模型,性能超越Whisper

    研究人员开发了BuzzASR,这是一套经过微调的、针对不同语言的100多款专用语音识别模型。这些模型基于Whisper架构,在许多语言上,特别是原始训练数据中代表性较低的语言上,其性能显著优于通用的Whisper Large V3模型。BuzzASR模型在27种语言的开源系统中达到了最先进的字符错误率,并引入了一种改进压缩率的分词器替换策略。

  5. TOOL · CL_233454 ·

    单说话人研究比较构音障碍自动语音识别的参数高效微调(PEFT)变体

    研究人员进行了一项案例研究,比较了七种参数高效微调(PEFT)变体,用于为构音障碍患者定制的自动语音识别(ASR)系统。该研究聚焦于一位患有严重中风后构音障碍的匈牙利男性说话人,在 Whisper Large V3 和 Qwen3-ASR-1.7B 两个基础ASR模型上评估了 LoRA、QLoRA、AdaLoRA、DoRA、LoHA、VeRA 和 VB-LoRA 等方法。结果表明,注意力投影适配器显著提高了准确性,尽管 LoHA 显示…

  6. TOOL · CL_232149 ·

    Groq API 的模型列表包含非聊天模型和隐藏的令牌限制

    对 Groq API 模型列表的审查发现,十四个已宣传的模型中有五个无法进行聊天补全。这些非聊天模型包括语音转文本和文本转语音变体,以及一个错误地将自身标识为 OpenAI GPT OSS 120B 的路由器模型。此外,一些模型存在无法发现的输出令牌限制,例如 llama-prompt-guard 模型最多需要 512 个令牌,而 allam-2-7b 模型需要 4096 个令牌,这些在模型列表中并未标明。

  7. TOOL · CL_218761 ·

    Together AI 按用例对顶级开源模型进行排名

    Together AI 发布了对顶级开源 AI 模型的比较分析,按其在各种用例中的性能进行分类。该分析重点介绍了 Kimi K3、DeepSeek V4 Pro 和 Qwen3.8 2.4T A95B 等模型在聊天、推理、编码代理和视觉能力等领域的优势。报告还确定了适用于较小、更快速部署和特定任务(如函数调用和语音转文本)的模型,其中包括 GPT OSS 20B 和 NVIDIA Nemotron 3.5 ASR 等选项。

  8. TOOL · CL_217881 ·

    为乳腺癌多学科团队会议开发设备端AI系统

    研究人员开发了一个设备端AI系统,旨在协助乳腺癌多学科团队会议。该系统利用开源自动语音识别(ASR)和大型语言模型(LLMs)来转录患者讨论、构建临床信息,并根据既定指南生成治疗建议。AI流程完全在本地硬件上运行,确保患者数据隐私和机构基础设施要求合规。评估显示,与基于云的对比系统相比,转录准确性和干预措施识别的准确性均有所提高。利益相关者认为自动化文档和决策支持是关键应用,同时也指出了工作流程整合和临床医生信任方面的挑战。

  9. TOOL · CL_212066 ·

    使用 Whisper 和 SraVaani 模型微调的新米佐语 ASR 系统

    研究人员通过收集和整理超过 17 小时的语音数据,为资源匮乏的米佐语开发了一个新的自动语音识别 (ASR) 系统。他们微调了三个 Whisper 多语言模型和 SraVaani 1.0 印度多语言模型。Whisper-large-v3 模型在常规评估中实现了 18.08% 的最低词错误率 (WER),在形态感知评估中为 7.22%。虽然 SraVaani 1.0 的初始 WER 较高,但微调显著提高了其性能,证明了适应性模型对未见语言的有效性。

  10. RESEARCH · CL_210255 ·

    Whisper语音识别模型适配多语言医疗用途

    研究人员分析了多语言医疗适配如何影响Whisper模型的内部表征。该研究比较了不同Whisper模型尺寸的各种微调策略,发现微调显著提高了MedASR的性能。在特定的诊断场景下,Whisper-Medium实现了最低的英语词错误率(WER),而Whisper-Large-v3实现了最低的德语WER。分析表明,英语医疗微调引起了编码器表征最显著的变化,而多语言延续在很大程度上保持了这些适配。

  11. COMMENTARY · CL_186550 ·

    免费的Whisper机器人比付费服务在嘈杂的俄语音频上表现更好

    最近的一项独立评测表明,免费的基于Whisper的机器人可以比Otter.ai等付费服务在转录嘈杂的俄语音频方面表现更好。虽然Adobe Enhance Speech和Cleanvoice AI等服务提供音频清理功能,但它们通常缺乏集成的转录功能。SberDevices已根据开放许可发布了GigaAM-CTC,声称在干净音频上的准确性优于Whisper,尽管其在嘈杂的真实世界录音上的表现尚不清楚。评测表明,转录质量,尤其是在处理挑战性…

  12. COMMENTARY · CL_182441 ·

    自托管开源语音转文本模型会产生隐藏成本

    自托管开源语音转文本模型,如 Whisper Large V3、Qwen3 ASR 以及 NVIDIA 的 Parakeet 和 Canary,最初可能看起来是免费的,但其总体拥有成本却相当可观。除了模型权重之外,用户还必须考虑 GPU 基础设施的巨大开销,这通常涉及支付闲置时间费用或处理冷启动问题。此外,原始检查点缺乏关键的生产功能,例如准确的说话人分离和针对真实世界数据的可靠实体格式化,而这些功能通常包含在托管 API 提供商的服务中。

  13. TOOL · CL_182440 ·

    AssemblyAI 推 Universal-3.5 Pro 优于 Whisper,用于生产语音转文本

    AssemblyAI 发布了一项比较,强调其 Universal-3.5 Pro 模型在生产语音转文本应用方面优于 OpenAI 的 Whisper Large-v3。虽然 Whisper 适用于干净音频和原型设计,但 AssemblyAI 认为其模型在嘈杂音频、交叉对话和专业术语的实际场景中表现更佳。关键区别包括更低的幻觉率、集成的说话人分离、关键数据改进的实体准确性以及内置流式传输功能,AssemblyAI 声称与自托管 Whis…

  14. RESEARCH · CL_158578 ·

    新AI模型利用连续方言空间预测阿拉伯语说话人来源

    研究人员开发了一种新颖的基于回归的方法,通过将方言变异建模为连续空间来预测阿拉伯语说话人的地理来源。该方法利用了分层神经网络,该网络结合了来自XLS-R 300M和Whisper Large V3的音频编码器表示以及语音学描述符。该模型实现了481.2公里的中位数定位误差,辅助头在国家预测方面达到64.5%的准确率,在城市预测方面达到45.2%。在零样本(zero-shot)机制下的进一步测试显示性能有所下降,突显了未来改进的领域。

  15. TOOL · CL_145843 ·

    研究发现音频分离损害零样本 ASR 性能

    一项新的研究论文调查了一个违反直觉的发现,即音频分离会降低零样本自动语音识别 (ASR) 系统的性能。该研究在嘈杂的孟加拉语和英语语音上,评估了 SAM-Audio 作为 OpenAI 的 Whisper 模型预处理步骤的效果。与预期相反,应用 SAM-Audio(提高了 PSNR 等音频质量指标)导致在所有测试的 Whisper 变体和数据集上,词错误率 (WER) 和字符错误率 (CER) 都有所增加。这表明信号级别的质量提升并不…

  16. RESEARCH · CL_133160 ·

    基于Whisper的新系统改进了巴西葡萄牙语的韵律边界检测

    研究人员开发了SAMPA,一个用于自动分割巴西葡萄牙语语音韵律边界的新系统。该系统基于微调Whisper large-v3模型,相比于该语言现有的基于规则或传统机器学习的方法是一个重大进步。SAMPA表现出具有竞争力的性能,在独立测试集上达到0.731的F1分数,在多样化数据集上达到0.796,表明其通过分析语形、语义和韵律线索来准确识别语音单元的能力。

  17. SIGNIFICANT · CL_131038 ·

    NVIDIA 发布 Audex,一个统一的音频-文本大语言模型,保留文本智能

    NVIDIA 推出了 Audex (Nemotron-Labs-Audex-30B-A3B),一个能够理解和生成音频及语音的统一音频-文本大语言模型。与许多文本性能有所下降的多模态模型不同,Audex 的设计旨在保持其 Nemotron-Cascade-2-30B-A3B 骨干模型的文本智能。该模型通过多阶段训练过程和纯文本强化学习来实现这一点,从而在文本基准测试中取得有竞争力的分数,并具备强大的音频能力,包括超越语音的通用音频生成。

  18. RESEARCH · CL_127566 ·

    Apple 和 Cohere 通过专用高效模型推进 ASR

    Apple 的机器学习研究团队开发了一种使用紧凑型 seq2seq 模型进行自动语音识别 (ASR) 错误纠正的新方法。这些模型在真实和合成 ASR 错误上进行训练,在效率和准确性方面,尤其是在低错误场景下,显著优于大型语言模型 (LLM)。与此同时,Cohere 推出了 Transcribe,一个拥有 20 亿参数的 ASR 模型,据报道其在速度和精度方面,尤其是在阿拉伯语方言方面,超越了 Whisper Large V3。

  19. RESEARCH · CL_117313 ·

    自动语音识别系统和人类在识别荷兰语构音障碍语音时遇到困难

    一项新近发表在arXiv上的研究比较了人类听者和三种先进的自动语音识别(ASR)系统——Whisper-large-V3、Google Chirp 3和Omnilingual——在识别荷兰语构音障碍连续语音方面的性能。研究发现,人类和现成的ASR系统都面临显著困难,平均词错误率(WER)超过70%。然而,通过在构音障碍语音上微调ASR模型,可以大幅降低WER,个性化模型在识别性能上优于人类听者,并有望支持日常交流。

  20. RESEARCH · CL_163255 ·

    新紧凑型TTS模型Inflect-Micro-v2和Inflect-Nano-v2发布

    Owen独立开发并资助了Inflect-Micro-v2和Inflect-Nano-v2,这是两个新的文本到波形语音合成模型。这些模型专为本地、固定语音的英语TTS设计,优先考虑参数少于1000万(Micro)的质量,或参数少于400万(Nano)的更小占用空间。在人类偏好研究和可懂度测试中,这两个模型都表现出具有竞争力的性能,同时还提供快速的CPU推理。