PulseAugur
实时 06:52:09
实体 VGGSound

VGGSound

PulseAugur coverage of VGGSound — every cluster mentioning VGGSound across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_239576 ·

    新的 AVENUE 基准测试旨在评估音频-视频编辑模型

    研究人员推出了 AVENUE,这是一个旨在改进音频-视频编辑模型的新基准测试和评估框架。AVENUE 基准测试包含 1,291 个源剪辑和 7,957 条编辑指令,这些内容从 VGGSound 数据集中精心挑选而来,涵盖了针对音频、针对视频以及耦合的编辑。配套的评估框架具有模态感知和样本特定性,解决了现有系统中经常忽视意外跨模态变化的局限性。使用 AVENUE 进行的初步评估显示,当前模型在编辑一种模态时,无论使用何种编辑范式,都经常…

  2. TOOL · CL_151853 ·

    AV-JEPA 模型推进视听自监督学习

    研究人员推出了 AV-JEPA,这是一种新的自监督学习模型,它将 LeJEPA 扩展到处理音频和视觉数据。该模型利用早期融合的 Vision Transformer 和模态 dropout 进行掩码,旨在对齐全局视图和局部视图的嵌入。AV-JEPA 在 VGGSound 和 AudioSet 等数据集上取得了出色的分类性能,并提供了开箱即用的零样本视听检索功能,无需复杂的组件,如解码器或对比负样本。

  3. RESEARCH · CL_91022 ·

    FoleyGenEx框架通过高级控制统一视频到音频生成

    研究人员推出了一种新颖的统一视频到音频生成框架FoleyGenEx,该框架解决了现有方法的局限性。FoleyGenEx集成了多模态控制、帧级时间对齐和语义精确度,以实现同步且通用的音频合成。关键创新包括条件注入机制、多模态动态掩码策略以及基于副词的数据增强算法,该算法通过细微的语义增强了文本监督。在AudioCaps和VGGSound等数据集上的实验表明,FoleyGenEx在可控视频到音频生成方面取得了有竞争力的性能。