PulseAugur
实时 18:20:49
English(EN) AV-JEPA: Extending LeJEPA to Audio-Visual Self-Supervised Learning

AV-JEPA 模型推进视听自监督学习

研究人员推出了 AV-JEPA,这是一种新的自监督学习模型,它将 LeJEPA 扩展到处理音频和视觉数据。该模型利用早期融合的 Vision Transformer 和模态 dropout 进行掩码,旨在对齐全局视图和局部视图的嵌入。AV-JEPA 在 VGGSoundAudioSet 等数据集上取得了出色的分类性能,并提供了开箱即用的零样本视听检索功能,无需复杂的组件,如解码器或对比负样本。 AI

影响 推进了视听自监督学习和零样本检索能力。

排序理由 该集群包含一篇详细介绍新模型架构及其在基准测试中性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.AI 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

AV-JEPA 模型推进视听自监督学习

报道来源 [1]

  1. arXiv cs.AI TIER_1 English(EN) · Benjamin Robson, Santeri Mentu, Wenshuai Zhao, Arno Solin ·

    AV-JEPA:将 LeJEPA 扩展到视听自监督学习

    arXiv:2607.15295v1 Announce Type: cross Abstract: We present AV-JEPA, an elegant multimodal extension of LeJEPA to audio-visual self-supervised learning. Using an early-fusion Vision Transformer and modality dropout as masking, the model is trained to align the embeddings of glob…