PulseAugur
实时 10:01:57
实体 AudioCaps

AudioCaps

PulseAugur coverage of AudioCaps — every cluster mentioning AudioCaps across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
2
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
2
90 天内 4
层级分布 · 90 天
主题
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_128511 ·

    新的无编码器音频字幕模型CARD降低了推理成本

    研究人员开发了CARD,一种新颖的无编码器音频字幕模型,通过移除音频编码器显著降低了推理成本。该模型通过将预训练音频教师CLAP-HTSAT的表示策略性地路由到不同组件来蒸馏其知识:将感知阶段路由到投影仪,将语义阶段路由到LLM。这种方法在AudioCaps和Clotho等基准数据集上提高了性能,在推理时无需编码器即可达到55.4分。

  2. TOOL · CL_119518 ·

    SwiftAudio 使用仅字幕蒸馏实现高效文本到音频生成

    研究人员开发了 SwiftAudio,一种新颖的一步式文本到音频扩散模型,在蒸馏过程中无需配对音频数据。该方法仅使用文本字幕和预训练的扩散教师模型,将数据需求显著降低到约 45,000 个字幕。SwiftAudio 在一步式方法中取得了最先进的结果,并缩小了与更复杂的步进式扩散系统的性能差距。

  3. RESEARCH · CL_91022 ·

    FoleyGenEx框架通过高级控制统一视频到音频生成

    研究人员推出了一种新颖的统一视频到音频生成框架FoleyGenEx,该框架解决了现有方法的局限性。FoleyGenEx集成了多模态控制、帧级时间对齐和语义精确度,以实现同步且通用的音频合成。关键创新包括条件注入机制、多模态动态掩码策略以及基于副词的数据增强算法,该算法通过细微的语义增强了文本监督。在AudioCaps和VGGSound等数据集上的实验表明,FoleyGenEx在可控视频到音频生成方面取得了有竞争力的性能。

  4. TOOL · CL_51255 ·

    新方法压缩语言模型的音频令牌

    研究人员开发了一种名为局部时序双向合并(LTBM)的新方法,用于压缩音频语言模型中的音频令牌。这种无需训练的方法在时序窗口内合并相似的附近音频令牌,旨在降低推理成本和内存使用量。实验表明,这种局部感知合并对于音频字幕任务特别有益,尤其是在更高的压缩率下,而全局匹配在音频理解任务中表现更好。