研究人员开发了一个专为电信客户服务应用定制的合成孟加拉语语音数据集。该数据集包含 10,000 对音频-文本,总计约 26.82 小时的语音,并根据 CC-BY-4.0 许可在 Hugging Face 上公开提供。合成语音使用 OmniVoice 生成,重点关注语音克隆和自动语音识别 (ASR) 训练的标准化。使用经过微调的 Whisper ASR 模型进行的评估表明,文本-音频一致性很强,词错误率 (WER) 和字符错误率 (CER) 较低。 AI
影响 该数据集可以提高语音识别系统在电信客户服务等特定领域的性能。
排序理由 该项目描述了一个合成语音数据集的创建和评估,属于研究范畴。[lever_c_demoted from research: ic=1 ai=1.0]
- arXiv
- Bangla
- bengaliAI/tugstugi_bengaliai-regional-asr_whisper-medium
- Creative Commons Attribution 4.0 International
- Hugging Face
- OmniVoice
- Whisper
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →