Kokoro 82M v1.0 已成为领先的开源文本到语音模型。然而,在盲人偏好测试中,它比 Qwen-Audio-3.0-TTS-Plus 低 173 ELO 分。这一性能差距凸显了当前可下载的开源模型与 TTS 领域领先的商业产品之间的差距。 AI
影响 凸显了开源 TTS 模型与商业 TTS 模型之间的性能差距。
排序理由 新模型发布和基准测试比较。[lever_c_demoted from research: ic=1 ai=1.0]
在 Mastodon — fosstodon.org 阅读 →
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →