Ucf101
PulseAugur coverage of Ucf101 — every cluster mentioning Ucf101 across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
V-RAE 通过使用冻结的语义表示来推进视频生成
研究人员推出了 V-RAE,这是一种新颖的视频表示自编码器,旨在改进潜在视频生成。与优化像素级重建的先前模型不同,V-RAE 使用冻结的视觉基础模型表示来构建紧凑的生成潜在表示。这种方法有效地消除了时间冗余,同时保留了语义结构,从而在视频重建、生成和预测任务中取得了卓越的性能。V-RAE 在 K600 和 UCF101 等基准测试中取得了最先进的成果,证明了语义表示对于有效的视频生成建模至关重要。
-
新基准和方法推动视频生成模型评估
研究人员推出了 VGI-BENCH,这是一个旨在评估视频生成模型视觉智能的新基准。该基准包含 27 个任务和 810 个实例,旨在评估超越仅生成逼真最终帧的推理能力。初步评估显示,即使是 Seedance 2.0 等先进模型也只能达到 51.0% 的准确率,这表明在内部错误纠正和对输入条件的敏感性等方面仍有很大的改进空间。同时,提出了一种名为 V-RAE 的新方法,该方法利用冻结的视觉表示来创建用于视频生成的语义组织潜在空间,从而实现…
-
高斯视频Transformer通过2DGS分词推进视频表示
研究人员开发了高斯视频Transformer(GVT),一个利用前馈式二维高斯泼溅(2DGS)分词方案的创新视频表示框架。该方法通过根据信息内容动态分配渲染权重来增强空间适应性,并通过避免每视频优化来提高泛化能力。GVT还采用高斯集合划分策略来分离静态和动态内容,从而实现更紧凑的表示。在视频重建、动作识别、压缩和生成任务上的评估表明,在重建和压缩方面取得了最先进的性能,在其他领域也取得了有竞争力的结果。
-
新的知识蒸馏方法增强动作识别模型压缩
研究人员开发了一种新颖的通道动态知识蒸馏(KD)方法,称为 ASCD KD,以改进大型动作识别模型的压缩。该方法通过动态生成包含语义信息并保留运动细节的自适应样本来解决现有 KD 技术的局限性,而不是依赖于固定输入。此外,它应用了通道蒸馏强度,该强度考虑了不同通道在整个训练过程中不断变化的权重。在 UCF101、Kinetics-400 和 Something-Something-v2 等多个基准上的实验表明,ASCD KD 取得了最先进的性能。
-
码本容量在视频压缩质量上超越分辨率
研究人员发现,在分层离散视频压缩中,码本容量是影响感知质量的主要因素,而非空间分辨率。使用MS-VQ-VAE模型在不同码本大小和分辨率下进行的实证研究表明,增加码本容量可显著提高质量,而空间分辨率的变化影响甚微。与H.264和H.265编解码器相比,这些模型在匹配或较低比特率下的感知质量方面表现更优,这表明码本大小是生成视频模型中可扩展离散分词器的更关键设计变量。
-
HyperGS 通过快速、可泛化的高斯预测推进视频表示
研究人员开发了 HyperGS,这是一种新颖的前馈方法,可以直接在单次传递中预测视频的高斯表示,无需进行每视频优化。该方法在保持重建质量并泛化到更高分辨率和分布外视频的同时,将编码和解码速度提高了几个数量级。HyperGS 利用了因子化的时空 Transformer 和基于查询的 Transformer,并结合了动态秩几何正则化器来稳定训练并防止崩溃。该系统在 K400、SSv2 和 UCF101 等基准数据集上实现了显著的速度提升并提高了性能。
-
HyperGS 通过更快、更具泛化性的预测推进高斯视频表示
研究人员开发了 HyperGS,一种使用高斯泼溅法进行视频表示的新型前馈方法。与之前需要逐视频优化的方法不同,HyperGS 在单次传递中直接预测高斯表示,显著加快了编码和解码速度。该系统采用时空 Transformer 提取视频 token,并使用基于查询的 Transformer 生成高斯参数,通过动态几何正则化器解决训练退化问题。该方法实现了数量级的编码加速,可泛化到更高分辨率,并提高了标准基准上的重建质量。
-
新的MS-VQ-VAE方法实现了超低比特率视频压缩
研究人员开发了一种使用称为MS-VQ-VAE的离散潜在表示的新型视频压缩方法,该方法在低于每像素0.1比特的超低比特率下有效运行。该方法通过采用学习到的自回归先验来克服连续潜在表示的局限性,该先验利用码本使用模式来实现显著压缩。与H.264和H.265等成熟标准相比,该方法在UCF101数据集上实现了更高的感知质量和显著更低的比特率,表现优越。
-
新的Bit-ViP技术增强图像视觉隐私保护
研究人员开发了一种名为Bit-ViP的新图像混淆技术,旨在保护用于计算机视觉任务的图像中的视觉隐私。该方法结合了混沌系统生成的不可逆噪声和差分隐私,以防止对手重建原始图像。在UCF101和HMDB51等活动识别数据集上的实验表明,Bit-ViP在对抗各种重建攻击方面是有效的,并且优于现有方案。
-
新的比特平面技术通过混淆增强图像隐私以抵御重建攻击
研究人员开发了 Bit-ViP,一种新颖的图像混淆技术,旨在保护计算机视觉应用中的视觉隐私。该方法使用比特平面来保护图像,使其能够抵抗重建攻击,同时仍可用于识别任务。Bit-ViP 结合了混沌系统生成的不可逆噪声和差分隐私,以防止对手恢复原始图像。在活动识别数据集上的实验表明,Bit-ViP 在抵御各种安全威胁方面是有效的,并且优于现有的混淆方案。
-
新的 MoFore 框架推动自监督视频表示学习发展
研究人员推出了一种新颖的自监督视频表示学习框架 MoFore,该框架专注于从远距离上下文剪辑预测未来的潜在嵌入。与依赖像素级重建或语义对齐的先前方法不同,MoFore 学习时间预测表示。该框架结合了随机时间间隔预测和对比正则化,以增强鲁棒性并防止表示崩溃。在 UCF101 数据集上的实验表明,MoFore 在不需要动作标签的情况下学习到了时间上一致且语义上有意义的表示。
-
新的 CFE-PPAR 方法支持通过压缩实现隐私保护的视频行为识别
研究人员推出了一种新颖的隐私保护视频行为识别方法 CFE-PPAR,即使在压缩后仍能保持有效。与先前在加密视频压缩时性能显著下降的方法不同,CFE-PPAR 允许视频 Transformer 直接识别加密内容。这是通过使用与视频加密相同的密钥转换的参数来实现的,在 Motion-JPEG 和 H.264 等常见压缩标准下,在 UCF101 和 HMDB51 数据集上表现出优越的性能。