实体
self-supervised speech models
self-supervised speech models
PulseAugur coverage of self-supervised speech models — every cluster mentioning self-supervised speech models across labs, papers, and developer communities, ranked by signal.
总计 · 30天
0
90 天内 2
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 2
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 2 条
-
新的SPAM方法联合处理电话分割和识别
研究人员开发了一种名为基于S3M的语音激活映射(SPAM)的新颖方法,以联合解决语音处理中的电话分割和识别任务。该方法通过将S3M表示映射到语音特征激活来利用自监督语音模型(S3Ms)中的潜在语音结构。SPAM需要最少的语音转录数据,并在各种数据集上表现出强大的性能,甚至可以泛化到未见的语音。
-
新系统PhonoQ-2.0推进多语言语音特征识别
研究人员开发了PhonoQ-2.0,一个用于识别语音中语音特征的新型多语言系统。该系统利用自监督语音模型为每帧预测一个详细的22维特征向量,捕捉发音方式、元音质量、发音部位和清浊等方面的特征。PhonoQ-2.0在各种语言和语料库中表现出色,在域内和域外都取得了较高的宏观F1分数,并且与传统的基于音素的方法相比,在未见过(unseen)的语言上有了显著的改进。