PulseAugur
中
实时 17:39:33
实体 wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations

PulseAugur coverage of wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations — every cluster mentioning wav2vec 2.0: A Framework for Self-Supervised Learning of Speech Representations across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
23
90 天内 23
发布 · 30天
0
90 天内 0
论文 · 30天
21
90 天内 21
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 24 条
  1. TOOL · CL_277317 ·

    量子核方法在低资源音频深度伪造检测中表现好坏参半

    一篇新的研究论文探讨了量子核方法(特别是量子支持向量机,QSVM)在低资源、跨语料库场景下,与经典模型(如支持向量机,SVM 和多层感知机,MLP)相比,在检测音频深度伪造方面的有效性。研究发现,尽管 MLP 在严重领域转移下性能显著下降,但 QSVM 仍保持了显著的区分能力。然而,这种优势并非在所有转移方向上都一致,QSVM 有时表现低于随机水平。研究人员将这些发现解释为在分布转移下量子核归纳偏差的经验表征,而不是明确的量子优势,因…

  2. TOOL · CL_257056 ·

    新的SITA方法改进了语调语言的语音表示

    研究人员开发了SITA,这是一种新颖的自监督语音编码器自适应方法,旨在改进低资源语调语言的表示学习。SITA采用分阶段优化框架,结合了跨性别对比损失和音调排斥损失,以增强说话人不变性同时保留词汇音调。该方法还结合了CTC微调和知识蒸馏,以恢复面向识别的语言信息。在苗语和标准汉语上的评估表明,与现有基线相比,SITA在音调分离和自动语音识别(ASR)准确性之间实现了更优的权衡。

  3. TOOL · CL_245290 ·

    AI认知筛查模型对多语种使用者存在显著偏见

    arXiv上发表的一项新研究发现,用于基于语音的认知筛查的AI模型存在显著的假阳性偏差,尤其影响英国的多语种人群。研究发现,与单语英语使用者相比,包括Whisper、Wav2Vec 2.0和NeMo在内的模型将多语种使用者错误地标记为认知障碍的可能性高出约2.5倍。这种偏差在记忆、流畅性和阅读任务中更为明显,并且在模型使用DementiaBank等现有数据集进行训练时会加剧,这凸显了在医疗保健领域公平部署AI的迫切需求。

  4. TOOL · CL_245269 ·

    研究发现:语音基础模型学习到的单词表征超越了语音学

    一项新的研究论文调查了像HuBERT和wav2vec 2.0这样的自监督语音基础模型是否真正学习到了超越单纯语音内容的单词表征。研究发现,虽然这些模型在根据单词形式区分单词方面表现出色,但它们也发展出了独立于局部语音信息编码单词身份和属性的表征,尤其是在更深的层中。这种语音信息和单词级别信息的解耦有望改进单词发现任务并增强更高级的语言理解能力。

  5. TOOL · CL_235536 ·

    新的SISER模型通过对抗性训练改进语音情感识别

    研究人员开发了SISER,一种新颖的语音情感识别方法,解决了数据稀缺和说话人可变性问题。通过在对抗性训练框架中集成预训练的wav2vec 2.0模型进行特征提取和ECAPA-TDNN模型进行说话人判别,SISER旨在提高情感识别系统的泛化能力。在IEMOCAP数据库上的实验表明,SISER的准确率显著提高,达到60.63%,优于基线方法。

  6. TOOL · CL_210204 ·

    Netflix 使用多模态嵌入来个性化内容发现

    Netflix 已开发并实施了多模态嵌入,以增强其内容个性化系统。通过利用 CLIP 等模型进行图像嵌入,以及一个名为 MediaFM 的三模态基础模型(融合视觉、音频和文本信号),Netflix 提高了其个性化艺术作品和视频预览的能力。这种方法在冷启动性能、查询感知搜索和视频预览推荐方面取得了更好的效果,在离线和在线测试中均优于以前的单模态模型。该公司还建立了一个离线代理任务,以加速这些嵌入模型的实验和产品化。

  7. TOOL · CL_180659 ·

    新的基于MEG的语音解码模型识别关键神经驱动因素

    研究人员开发了一种新的方法,使用深度网络从脑磁图(MEG)记录中解码感知语音。这种改进的架构将模型权重映射到特定的脑区,并识别出沉默、声音强度和元音等关键语音特征作为检索的关键驱动因素。研究还发现,连贯的叙事语音比随机单词列表携带更多的可恢复信息,并且目标音频嵌入可以显著减少而不影响准确性。

  8. RESEARCH · CL_187897 ·

    新AI模型以改进的可解释性从大脑活动中解码语音

    研究人员开发了一种更具可解释性的深度学习模型,用于从脑磁图(MEG)记录中解码感知语音。这个新模型比以前的版本小约20倍,在MEG-MASC数据集上实现了39.75%的Top-1准确率。通过重新设计模型架构并采用源映射和输入干预,研究人员确定了诸如静音、声音强度、元音和声学起始等特定语音特征是检索的关键驱动因素。

  9. TOOL · CL_169622 ·

    新型EEGAlign框架可从脑电波解码中文语音

    研究人员开发了EEGAlign,一个新颖的框架,旨在直接从脑电图(EEG)信号中解码中文语音并生成文本。该方法解决了中文语言从非侵入式EEG解码中固有的高维输出空间和受试间变异性等挑战。EEGAlign利用对比学习,联合对齐来自BGE M3的文本嵌入和来自wav2vec 2.0的音频特征的EEG数据,然后进行CTC解码。该框架在中国EEG-2数据集上取得了最先进的性能,证明了其双重对齐轴对于语音产生和感知任务的互补优势。

  10. RESEARCH · CL_135171 ·

    语音合成评估受自动语音识别家族对齐干扰,提出新的集成方法

    研究人员发现,在使用自动语音识别(ASR)验证器评估文本到语音(TTS)系统时存在一个重大的混淆因素。这些验证器的表面质量很大程度上受用于判断的ASR家族影响,导致排名颠倒和性能指标虚高。为解决此问题,该论文提出跨家族排名集成方法,该方法可实现更低的词错误率,并在其他指标上保持性能,建议进行跨评估器三角测量以获得稳健的报告。

  11. TOOL · CL_123259 ·

    人工智能助力心音分类,用于心血管疾病检测

    研究人员开发了一种新颖的方法,利用多模态和多通道心音数据对心血管疾病进行分类。通过结合传统的信号处理与WaveGrad和DiffWave等去噪扩散模型,他们创建了一个增强型数据集。然后,该数据集被用于微调基于Wav2Vec 2.0的分类器,在各种数据集上取得了最先进的性能,包括单通道心电图(PCG)、同步的PCG和心电图(ECG)信号,以及来自可穿戴背心的多通道PCG(mPCG)。

  12. TOOL · CL_122608 ·

    苹果研究人员提出反因果域泛化,以实现鲁棒的AI模型

    Apple Machine Learning Research 发表了一篇关于反因果域泛化(Anti-Causal Domain Generalization)的论文,这是一种创建鲁棒预测模型的方法,可以在无需每个新环境的标签数据的情况下适应新环境。该方法通过关注结果影响观测协变量的反因果结构来利用无标签数据。这使得模型能够正则化其对不同环境中协变量均值和协方差变化的敏感性,提供了理论最优保证,并在物理系统和生理数据上取得了实证成功。

  13. TOOL · CL_117808 ·

    NTNU系统整合W2V和Phi-4用于口语评估

    来自NTNU的研究人员开发了一个新颖的口语评估(SLA)系统,该系统整合了wav2vec 2.0 (W2V) 模型和Phi-4多模态大语言模型(MLLM)。这种方法旨在克服现有方法的局限性,例如基于BERT的系统会遗漏韵律线索,而基于W2V的系统则缺乏语义可解释性。该组合系统在Speak & Improve Challenge 2025测试集上取得了0.375的均方根误差(RMSE),获得第二名。

  14. RESEARCH · CL_115290 ·

    新框架模拟语音AI声学攻击,错误率最高增加94.5% · 跟踪2个来源

    研究人员开发了一个新颖的框架,用于模拟针对语音控制AI系统的空中声学攻击。该框架进行了超过800万次对抗性评估,表明声学感知可以将Whisper和wav2vec等模型的词错误率(Word Error Rate)提高高达94.5%。该研究引入了双形式信噪比(Dual-Form Signal to Noise Ratio),以更好地理解攻击的有效性和隐蔽性,旨在促进该领域更鲁棒和可验证的研究。

  15. TOOL · CL_109485 ·

    Wav2Vec 2.0 模型可解释性用于病理性言语评估研究

    研究人员调查了用于评估口腔癌和口咽癌患者病理性言语的 Wav2Vec 2.0 模型的可解释性。他们使用典型相关分析测量了模型嵌入与声学特征之间的相关性。研究发现,模型学习到的表征与频谱和韵律特征最相关,其中梅尔频率倒谱系数的第一阶在所有层中显示出最高的关联度。这项研究不仅有助于理解言语评估模型如何编码声学信息,还为在病理性言语分析中选择声学特征提供了实用见解。

  16. RESEARCH · CL_107825 ·

    语音模型编码非裔美国人英语辅音簇简化

    研究人员调查了 wav2vec 2.0 和 Whisper 等语音模型如何表示非裔美国人英语 (AAE) 中的辅音簇简化 (CCR)。研究发现,这两种模型都能准确地区分 CCR 的简化形式和规范形式。重要的是,模型保留了对底层声音的线索,这表明 CCR 被编码为一种结构化的音系变异,而不是简单的删除。

  17. RESEARCH · CL_93567 ·

    AI模型编码罗素情感模型,但稀有类别带来几何挑战

    两篇新的arXiv论文探讨了AI模型中情感表示的几何特性。第一篇论文证明了多模态Transformer可以与罗素的情感维度模型完美对齐,表明该模型的结构已内在地编码在嵌入中。第二篇论文认为,稀有类别情感识别的失败是由于这些类别在维度模型上的几何退化,而非简单的类别不平衡,并提出需要新的表示方法来区分这些情感。

  18. TOOL · CL_82579 ·

    CNN-Transformer 将阿拉伯语语音情感识别准确率提升至 98.1%

    研究人员开发了一个新的深度学习框架,以改进阿拉伯语语音情感识别,这项任务因方言多样性和有限的数据集而历来具有挑战性。该研究比较了三种架构:CNN-LSTM、CNN-Transformer 和微调的 wav2vec 2.0 模型。实验表明,CNN-Transformer 架构实现了 98.1% 的准确率,通过有效结合频谱特征提取和全局上下文建模,优于其他模型。

  19. TOOL · CL_80074 ·

    自监督模型GNSS-FM推动地震位移分析

    研究人员开发了GNSS-FM,这是一种新颖的自监督基础模型,用于分析每日全球导航卫星系统(GNSS)位移时间序列。该模型采用结合位移和速度数据的双流输入,并以掩码潜在预测目标进行预训练。在对来自超过17,000个GNSS站点的数据进行预训练后,GNSS-FM在针对位移预测和地震步态定位进行微调时表现出色,优于现有的特定任务基线。

  20. RESEARCH · CL_43983 ·

    新的模拟模型揭示语音理解的认知极限

    研究人员开发了 RAMPHO 缓冲区的计算机模拟,这是多说话者聆听环境中的认知瓶颈。该模拟使用 wav2vec 2.0 声学模型的语音熵来区分信息掩蔽和能量掩蔽。研究揭示了一种权衡:在高信噪比下,去除干扰项的语义内容有助于聆听,但在较低信噪比下会损害时间线索感知。