实体
HuBERT-large
HuBERT-large
PulseAugur coverage of HuBERT-large — every cluster mentioning HuBERT-large across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 1
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 1
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
-
PhonoQ 使用音频-发音 MRI 数据增强语音分类
研究人员开发了一种方法,通过结合来自 PhonoQ(一个在语音学特征上训练的音频模型)的表示,来提高基于音频和实时 MRI 发音数据的语音分类能力。该方法提高了识别语音和语音学类别的准确性。这种方法在对未见过的主体和语音模式进行分类时,甚至在仅有发音数据可用的情况下,都显示出改进,证明了语音学信息从音频模型到发音模型的迁移能力。
-
语音模型通过参数聚类进行压缩
研究人员开发了一种无需额外数据或重新训练即可压缩语音基础模型的新方法。该方法利用k-means进行通道聚类,通过改变每层的聚类数量来探索混合稀疏性剪枝。在LibriSpeech上的实验表明,与基于幅值的剪枝相比,在HuBERT-large和Whisper-large-v3等模型上,即使在相当高的稀疏度下,词错误率(WER)也显著降低。
-
人工智能评估韩国幼儿发音
研究人员开发了一个自动系统来评估韩国幼儿的发音,填补了当前评估工具的空白。该系统利用神经说话人分割和自监督学习技术来分析语音录音。在一个新创建的包含53名儿童录音的语料库上进行的实验显示出有希望的结果,一个集成模型在发音评分方面达到了0.782的平均平衡准确率。