研究人员推出了 AV-JEPA,这是一种新的自监督学习模型,它将 LeJEPA 扩展到处理音频和视觉数据。该模型利用早期融合的 Vision Transformer 和模态 dropout 进行掩码,旨在对齐全局视图和局部视图的嵌入。AV-JEPA 在 VGGSound 和 AudioSet 等数据集上取得了出色的分类性能,并提供了开箱即用的零样本视听检索功能,无需复杂的组件,如解码器或对比负样本。 AI
影响 推进了视听自监督学习和零样本检索能力。
排序理由 该集群包含一篇详细介绍新模型架构及其在基准测试中性能的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →