AudioCaps
PulseAugur coverage of AudioCaps — every cluster mentioning AudioCaps across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的无编码器音频字幕模型CARD降低了推理成本
研究人员开发了CARD,一种新颖的无编码器音频字幕模型,通过移除音频编码器显著降低了推理成本。该模型通过将预训练音频教师CLAP-HTSAT的表示策略性地路由到不同组件来蒸馏其知识:将感知阶段路由到投影仪,将语义阶段路由到LLM。这种方法在AudioCaps和Clotho等基准数据集上提高了性能,在推理时无需编码器即可达到55.4分。
-
SwiftAudio 使用仅字幕蒸馏实现高效文本到音频生成
研究人员开发了 SwiftAudio,一种新颖的一步式文本到音频扩散模型,在蒸馏过程中无需配对音频数据。该方法仅使用文本字幕和预训练的扩散教师模型,将数据需求显著降低到约 45,000 个字幕。SwiftAudio 在一步式方法中取得了最先进的结果,并缩小了与更复杂的步进式扩散系统的性能差距。
-
FoleyGenEx框架通过高级控制统一视频到音频生成
研究人员推出了一种新颖的统一视频到音频生成框架FoleyGenEx,该框架解决了现有方法的局限性。FoleyGenEx集成了多模态控制、帧级时间对齐和语义精确度,以实现同步且通用的音频合成。关键创新包括条件注入机制、多模态动态掩码策略以及基于副词的数据增强算法,该算法通过细微的语义增强了文本监督。在AudioCaps和VGGSound等数据集上的实验表明,FoleyGenEx在可控视频到音频生成方面取得了有竞争力的性能。
-
新方法压缩语言模型的音频令牌
研究人员开发了一种名为局部时序双向合并(LTBM)的新方法,用于压缩音频语言模型中的音频令牌。这种无需训练的方法在时序窗口内合并相似的附近音频令牌,旨在降低推理成本和内存使用量。实验表明,这种局部感知合并对于音频字幕任务特别有益,尤其是在更高的压缩率下,而全局匹配在音频理解任务中表现更好。