Audio Spectrogram Transformer
PulseAugur coverage of Audio Spectrogram Transformer — every cluster mentioning Audio Spectrogram Transformer across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新框架使用软提示进行多模态情感估计
研究人员开发了一种新的多模态框架,用于估计人类情感中的效价-唤醒度(VA),该框架利用了距离感知软提示引导。该方法将VA空间划分为离散区域,使用高斯核计算基于欧氏距离的软标签,从而实现更精细的情感过渡学习。该框架集成了来自CLIP图像编码器的视觉特征和来自Audio Spectrogram Transformer的声学特征,并通过门控循环单元和分层融合方案进行时间建模。
-
AI模型通过新技术推进呼吸音分类
两篇新研究论文提出了用于呼吸音分类的先进AI技术。一篇论文介绍了QLung,一个质量自适应框架,它根据录音质量调整学习裕度,从而提高了在ICBHI和SPRSound数据集上的性能。另一篇论文Lung-SRAD,探索了状态空间模型作为Transformer在该任务上的替代方案,并结合了频谱感知正则化和对比学习,在ICBHI基准测试上比基线方法提高了5%。
-
AI 代理 Warp 通过音频检测实现咖啡烘焙自动化
一位工程师详细介绍了如何使用名为 Warp 的终端开发 AI 代理来自动化咖啡烘焙过程。该系统采用了四个不同的 AI 代理,每个代理都有专门的角色,用于管理咖啡烘焙机并使用音频分析检测关键阶段,如一爆。这种设置实现了全自动化烘焙,工程师只需对加热和风扇设置做出高级决策,而 AI 则负责实时检测和记录事件。
-
DiBA 方法使用对角线和二值矩阵压缩神经网络权重
研究人员开发了 DiBA,一种通过用对角线和二值矩阵的组合近似密集矩阵来压缩神经网络权重的新颖方法。该技术显著降低了矩阵向量乘法的计算成本,将乘法次数从 mn 减少到 m+k+n。DiBA 还引入了高效的优化策略,包括 DiBA-Greedy 和 DiBARD,这些策略在文本分类和音频识别等下游任务中,无需大量重新训练即可显著提高准确性。