AssemblyAI 发布了其 Universal-3.5 Pro 和 Universal-3.5 Pro Realtime 语音转文本模型的新基准数据,报告的归一化词错误率 (WER) 分别为 4.35% 和 5.53%。该公司强调,WER 本身不足以作为比较供应商的指标,并强调了连接最小置换词错误率 (cpWER) 和漏识别实体率 (MER) 等指标在对话应用中的重要性。AssemblyAI 的数据显示,与其他模型在 Pipecat 开放 STT 基准测试(评估流式模型在真实语音代理对话中的表现)相比,实体识别准确性存在显著差距。 AI
影响 强调了除词错误率之外的具体指标在评估实际应用中语音转文本模型的重要性。
排序理由 博文详细介绍了现有语音转文本模型的性能指标和基准测试。
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →