AssemblyAI 发现标准词错误率(WER)语音转文本模型基准测试存在缺陷。他们的 Universal-3 Pro 模型虽然内部显示出卓越的性能,但在客户基准测试中表现却更差,这是由于 WER 的计算方式。问题源于 Whisper Normalizer,它经常错误地将正确转录的口语词标记为插入,特别是专有名词和字母数字,导致基准测试结果具有误导性。 AI
影响 凸显了语音转文本模型评估中潜在的不准确性,影响了性能的衡量和比较方式。
排序理由 博客文章讨论了常见行业基准测试的局限性。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →