PulseAugur
实时 06:32:14
实体 Mel-frequency cepstrum

Mel-frequency cepstrum

PulseAugur coverage of Mel-frequency cepstrum — every cluster mentioning Mel-frequency cepstrum across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 10
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 10
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 10 条
  1. TOOL · CL_231403 ·

    新的MADS描述符集捕捉超越频谱摘要的声音物理学

    研究人员推出MADS(多视图声学描述符集),这是一个新颖的19维描述符集,旨在超越传统的频谱摘要,更全面地理解音频信号。与专注于手工制作的紧凑特征或固定时频表示的现有方法不同,MADS编码了激励、阻尼、周期性和脉冲性等物理动力学。在ESC-10、ESC-50和MSoS等标准数据集上进行测试时,MADS与传统手工制作的基线相比表现更优,取得了最强的峰值结果,并使用了更紧凑的维度。

  2. TOOL · CL_206453 ·

    新的无参数方法评估大象发声的少样本学习

    研究人员开发了一种无参数的方法来评估大象发声分类中的少样本学习。该方法在固定的声学嵌入上使用最近邻分类器,并将其性能与在不同数据集和样本数量上的全训练模型进行比较。这种无参数方法显示出潜力,尤其是在Elephant Voices等低资源数据集上,在标记示例稀缺时,它可以优于训练过的分类器。

  3. TOOL · CL_165106 ·

    音频基础模型在无领域特定训练的情况下捕获系统发育信号

    一项发表在arXiv上的新研究调查了大型音频基础模型是否能在没有明确为此目的进行训练的情况下,从物种发声中捕获系统发育信号。研究发现,像CLAP和BEATs-bio这样的通用模型在恢复海洋哺乳动物和鸟类物种的系统发育距离方面表现出显著能力,其性能优于手工制作的特征。令人惊讶的是,像BirdNET这样的领域特定模型并未显示出更优越的性能,这表明在音频数据上进行广泛的预训练可能足以编码进化信息。

  4. TOOL · CL_156527 ·

    浏览器原生AI以97%的准确率对电吉他弦进行分类

    研究人员开发了Fretiq,一个直接在网络浏览器中对电吉他弦进行分类的新颖系统。该系统利用了26维特征表示,包括梅尔频率倒谱系数(MFCCs)、频谱统计和频带能量。Fretiq在帧级别验证准确率达到97.1%,在独立自由弹奏评估中准确率为87.8%。该系统还引入了一种名为“对比训练”的新数据收集方法,旨在提高对听起来相似的音符的区分度。

  5. TOOL · CL_141408 ·

    AI通过语音声学特征检测阿尔茨海默病

    研究人员开发了一种仅使用自发语音音频检测阿尔茨海默病的方法。该方法无需转录或计算密集型深度学习模型,而是专注于手工制作的声学-时间特征,如停顿和流畅性统计数据,以及梅尔频率倒谱系数(MFCC)。使用具有RBF核的支持向量机在DementiaBank Pitt语料库上进行训练,该系统取得了0.674的平均AUC,证明了在阿尔茨海默病早期筛查中使用频谱-时间(spectro-temporal)和流畅性线索的潜力。

  6. TOOL · CL_109485 ·

    Wav2Vec 2.0 模型可解释性用于病理性言语评估研究

    研究人员调查了用于评估口腔癌和口咽癌患者病理性言语的 Wav2Vec 2.0 模型的可解释性。他们使用典型相关分析测量了模型嵌入与声学特征之间的相关性。研究发现,模型学习到的表征与频谱和韵律特征最相关,其中梅尔频率倒谱系数的第一阶在所有层中显示出最高的关联度。这项研究不仅有助于理解言语评估模型如何编码声学信息,还为在病理性言语分析中选择声学特征提供了实用见解。

  7. RESEARCH · CL_98093 ·

    新款AI模型利用语音和迁移学习解决中文方言鉴别问题 · 追踪4个来源

    两篇新研究论文提出了区分中文方言的先进方法,这项任务由于文本数据有限而历来具有挑战性。一篇论文介绍了一种语音驱动的方法,使用梅尔频率倒谱系数(MFCC)和CNN-HMM-DNN模型从音频中识别方言。第二篇论文侧重于低资源场景,采用迁移学习和数据增强技术,并结合CDDTLDA框架和自注意力机制,以改进方言鉴别的自动语音识别。

  8. RESEARCH · CL_95818 ·

    新论文概述了微控制器的嵌入式机器学习工作流程

    一篇新论文详细介绍了一个在微控制器上实现机器学习的全面工作流程,重点关注资源受限设备的工程挑战。它涵盖了数据采集、信号预处理、特征提取、模型验证以及设备端推理的部署策略。该研究以惯性运动识别和关键词识别为例,说明了稳健的嵌入式机器学习系统的实际设计规则。

  9. RESEARCH · CL_91207 ·

    新研究利用先进的AI模型解决欺骗语音检测问题

    研究人员正在开发先进的方法来检测欺骗语音,由于逼真的合成和语音转换技术,这是一个日益严峻的挑战。一种方法是时间金字塔适配器(Temporal Pyramid Adapter),它使用具有不同感受野的并行时间卷积来捕获多尺度欺骗线索,并整合XLS-R等自监督表示。另一项研究推出了ArFake,这是第一个多方言阿拉伯语欺骗语音数据集,以解决该领域有限的研究。第三篇论文将自监督语音模型转换为专家混合(Mixture-of-Experts)架…

  10. TOOL · CL_20726 ·

    CNN 在印地语语音识别关键词识别中达到 91.79% 的准确率

    研究人员开发了一种使用卷积神经网络 (CNN) 的印地语语音识别关键词识别系统。该系统在 40,000 个音频样本上进行了训练,并将梅尔频率倒谱系数 (MFCC) 作为 CNN 的输入。对各种 CNN 架构进行的实验表明,在识别连续印地语语音中的关键词方面,准确率达到了显著的 91.79%,强调了计算效率和用户特定定制。