PulseAugur
中
实时 20:08:56
实体 visual representation learning

visual representation learning

PulseAugur coverage of visual representation learning — every cluster mentioning visual representation learning across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. RESEARCH · CL_212024 ·

    NAPE框架通过预测下一个补丁嵌入来推进音频表示学习

    研究人员推出了一种新颖的音频自监督学习框架NAPE(Next-Audio-Patch-Embedding prediction)。该方法利用因果Transformer,通过预测对数梅尔频谱图的后续补丁嵌入来从先前的嵌入中学习,并将因果掩码和停止梯度作为其主要的训练信号。NAPE在六个音频和语音基准测试中取得了最先进的微调性能,展示了随着编码器尺寸的持续扩展和强大的线性探测结果。

  2. TOOL · CL_109963 ·

    新的PRIOR框架增强了视觉表示学习

    研究人员开发了一个名为PRIOR(Predictive Residual Inference for Ordered Representations)的新框架,以改进有序瓶颈中的视觉表示学习。PRIOR通过用关注残差误差的逐级预测器取代激活率控制,解决了现有方法(如基于掩码的排序压力MBOP)的局限性。在对比学习和图像重建中的实验表明,PRIOR能有效地学习有序表示,在低预算下提供粗略描述符,在高预算下提供精炼,并且在离散和量化设置中…

  3. RESEARCH · CL_93333 ·

    新AI方法在无强假设下学习视觉表示

    研究人员引入了视觉时间差(TDV),一种新的视频自监督学习范式,旨在减少对强归纳偏置的依赖。与使用增强或掩码的现有方法不同,TDV假设过去导致未来,训练图像和运动编码器来预测下一帧的表示。这种方法在密集空间任务上匹配了最先进的性能,而无需强假设,这表明了一条通往以更少固有偏见进行大规模表示学习的道路。