VGGSound
PulseAugur coverage of VGGSound — every cluster mentioning VGGSound across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
新的 AVENUE 基准测试旨在评估音频-视频编辑模型
研究人员推出了 AVENUE,这是一个旨在改进音频-视频编辑模型的新基准测试和评估框架。AVENUE 基准测试包含 1,291 个源剪辑和 7,957 条编辑指令,这些内容从 VGGSound 数据集中精心挑选而来,涵盖了针对音频、针对视频以及耦合的编辑。配套的评估框架具有模态感知和样本特定性,解决了现有系统中经常忽视意外跨模态变化的局限性。使用 AVENUE 进行的初步评估显示,当前模型在编辑一种模态时,无论使用何种编辑范式,都经常…
-
AV-JEPA 模型推进视听自监督学习
研究人员推出了 AV-JEPA,这是一种新的自监督学习模型,它将 LeJEPA 扩展到处理音频和视觉数据。该模型利用早期融合的 Vision Transformer 和模态 dropout 进行掩码,旨在对齐全局视图和局部视图的嵌入。AV-JEPA 在 VGGSound 和 AudioSet 等数据集上取得了出色的分类性能,并提供了开箱即用的零样本视听检索功能,无需复杂的组件,如解码器或对比负样本。
-
FoleyGenEx框架通过高级控制统一视频到音频生成
研究人员推出了一种新颖的统一视频到音频生成框架FoleyGenEx,该框架解决了现有方法的局限性。FoleyGenEx集成了多模态控制、帧级时间对齐和语义精确度,以实现同步且通用的音频合成。关键创新包括条件注入机制、多模态动态掩码策略以及基于副词的数据增强算法,该算法通过细微的语义增强了文本监督。在AudioCaps和VGGSound等数据集上的实验表明,FoleyGenEx在可控视频到音频生成方面取得了有竞争力的性能。