研究人员推出SoniSpeech,一个新推出的、大规模的、开放词汇的数据集,专为可穿戴静默语音界面(SSIs)设计。这个三模态数据集同步了超声回波图谱、语音音频和前置视频,捕捉了语音和静默语音。SoniSpeech包含18,000个话语,总计34小时,源自SODA对话数据集,具有当代对话式英语,包含超过5,000个独特单词和完整的音素覆盖。一个使用CTC基础的ResNet-34的基线模型在静默语音识别任务上达到了26.3%的词错误率,为这个新兴领域建立了第一个基准。 AI
影响 该数据集有望加速开发更通用、侵入性更小的静默语音界面。
排序理由 该集群包含一篇介绍特定AI任务新数据集和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →