PulseAugur
实时 09:20:14
English(EN) SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces

新的SoniSpeech数据集推动开放词汇静默语音识别发展

研究人员推出SoniSpeech,一个新推出的、大规模的、开放词汇的数据集,专为可穿戴静默语音界面(SSIs)设计。这个三模态数据集同步了超声回波图谱、语音音频和前置视频,捕捉了语音和静默语音。SoniSpeech包含18,000个话语,总计34小时,源自SODA对话数据集,具有当代对话式英语,包含超过5,000个独特单词和完整的音素覆盖。一个使用CTC基础的ResNet-34的基线模型在静默语音识别任务上达到了26.3%的词错误率,为这个新兴领域建立了第一个基准。 AI

影响 该数据集有望加速开发更通用、侵入性更小的静默语音界面。

排序理由 该集群包含一篇介绍特定AI任务新数据集和基准的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.LG 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的SoniSpeech数据集推动开放词汇静默语音识别发展

报道来源 [1]

  1. arXiv cs.LG TIER_1 English(EN) · Ruidong Zhang, Jiacheng Liu, Fran\c{c}ois Guimbreti\`ere, Cheng Zhang ·

    SoniSpeech: A Large-Scale Open-Vocabulary Tri-Modal Dataset for Wearable Silent Speech Interfaces

    arXiv:2608.00803v1 Announce Type: cross Abstract: Wearable silent speech interfaces (SSIs) are limited to small, closed vocabularies. Approaches achieving larger vocabularies require obtrusive hardware such as facial electrodes. We present SoniSpeech, the first large-scale, open-…