Audio Spectrogram Transformer
PulseAugur coverage of Audio Spectrogram Transformer — every cluster mentioning Audio Spectrogram Transformer across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新方法利用人工智能和人类验证来模拟音乐品味关联
研究人员开发了一种计算方法来模拟音乐与品味之间的联系,解决了文化遗产计算中的数据瓶颈问题。他们的方法包括使用在较小数据集上训练的模型来扩展带注释的收藏集,然后将这些合成标签与原始注释和人类感知进行验证。实验表明,即使扩展到大型数据集,音频-风味模式仍然存在,并且计算出的风味特征与听众的感知相符。
-
新方法以最小的精度损失加速音频频谱图 Transformer 训练
研究人员开发了一种名为 SpecAugment-Patch Merging 的新方法,以提高音频频谱图 Transformer (AST) 训练的效率。该技术涉及在块级别掩码频谱图,然后合并这些掩码块的对。在 AudioSet、ESC-50 和 Speech Commands V2 等数据集上的实验表明,这种合并方法在精度仅略有下降的情况下,将训练吞吐量显著提高了 13.9%,展示了更高效的音频分析模型训练过程。
-
新的pFedMARL方法利用MARL改进非独立同分布数据的联邦学习
研究人员推出了一种新的联邦学习方法pFedMARL,该方法利用多智能体强化学习来应对非独立同分布数据带来的挑战。该方法在聚合过程中动态调整客户端贡献,以增强全局模型的鲁棒性和公平性。该系统在半监督音频频谱图Transformer上进行了测试,与FedAvg和Ditto等标准方法相比,即使存在对抗性客户端,其准确性和弹性也有所提高。
-
新框架使用软提示进行多模态情感估计
研究人员开发了一种新的多模态框架,用于估计人类情感中的效价-唤醒度(VA),该框架利用了距离感知软提示引导。该方法将VA空间划分为离散区域,使用高斯核计算基于欧氏距离的软标签,从而实现更精细的情感过渡学习。该框架集成了来自CLIP图像编码器的视觉特征和来自Audio Spectrogram Transformer的声学特征,并通过门控循环单元和分层融合方案进行时间建模。
-
AI模型通过新技术推进呼吸音分类
两篇新研究论文提出了用于呼吸音分类的先进AI技术。一篇论文介绍了QLung,一个质量自适应框架,它根据录音质量调整学习裕度,从而提高了在ICBHI和SPRSound数据集上的性能。另一篇论文Lung-SRAD,探索了状态空间模型作为Transformer在该任务上的替代方案,并结合了频谱感知正则化和对比学习,在ICBHI基准测试上比基线方法提高了5%。
-
AI 代理 Warp 通过音频检测实现咖啡烘焙自动化
一位工程师详细介绍了如何使用名为 Warp 的终端开发 AI 代理来自动化咖啡烘焙过程。该系统采用了四个不同的 AI 代理,每个代理都有专门的角色,用于管理咖啡烘焙机并使用音频分析检测关键阶段,如一爆。这种设置实现了全自动化烘焙,工程师只需对加热和风扇设置做出高级决策,而 AI 则负责实时检测和记录事件。
-
DiBA 方法使用对角线和二值矩阵压缩神经网络权重
研究人员开发了 DiBA,一种通过用对角线和二值矩阵的组合近似密集矩阵来压缩神经网络权重的新颖方法。该技术显著降低了矩阵向量乘法的计算成本,将乘法次数从 mn 减少到 m+k+n。DiBA 还引入了高效的优化策略,包括 DiBA-Greedy 和 DiBARD,这些策略在文本分类和音频识别等下游任务中,无需大量重新训练即可显著提高准确性。