PulseAugur
中
实时 21:39:29
实体 Ucf 101 Action Recognition Dataset

Ucf 101 Action Recognition Dataset

PulseAugur coverage of Ucf 101 Action Recognition Dataset — every cluster mentioning Ucf 101 Action Recognition Dataset across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
7
90 天内 7
发布 · 30天
0
90 天内 0
论文 · 30天
7
90 天内 7
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 8 条
  1. TOOL · CL_196201 ·

    Stream Forcing框架提升流式视频生成质量

    研究人员开发了一个名为Stream Forcing的新框架,以提高流式视频生成模型的质量和鲁棒性。该方法通过将视频扩散采样重新构建为帧索引随机过程,解决了训练和推理之间的不匹配问题。Stream Forcing构建了一个从独立采样到推理一致性采样的连续训练轨迹,确保了平滑性和跨帧相关性。实验表明,在UCF-101等基准测试中,生成质量和零样本外推能力得到了显著提升。

  2. TOOL · CL_194016 ·

    新的DeepMORSE方法利用文本数据增强图像聚类

    研究人员开发了一种名为DeepMORSE的新方法,用于图像聚类,该方法利用了来自视觉语言模型的文本信息。该方法旨在通过学习一种模态共享的自表达模型来改进聚类,该模型同时捕获跨模态结构并保留模态特定信息。该方法在UCF-101、DTD-47和ImageNet-Dogs等多个基准测试中显示出性能提升,并证明了其在图像检索和零样本分类等下游任务中的强大迁移能力。

  3. TOOL · CL_191408 ·

    新型Transformer模型实现高效边缘动作识别

    研究人员开发了CoDAT,一种用于边缘设备上高效动作识别的协作双注意力Transformer。该模型采用轻量级双分支注意力机制,结合用于局部特征聚合的空间卷积注意力(SCA)和用于全局上下文的跨步单头注意力(SSHA),显著降低了计算成本。CoDAT还包含一个无参数的TShift模块用于时间建模,实现了跨帧的高效通信。实验表明,CoDAT在各种基准测试中实现了优于现有方法的能耗-准确性平衡,为边缘物联网系统中的实时应用提供了更快的吞吐…

  4. TOOL · CL_161009 ·

    弹性循环Transformer提供参数高效的视觉生成

    研究人员推出了一种新颖的视觉生成方法——弹性循环Transformer (ELT),该方法在保持高合成质量的同时显著减少了参数数量。该方法利用迭代的、权重共享的Transformer块以及一种称为“循环内自蒸馏”(ILSD)的技术进行高效训练。ELT支持“任意时间”推理,允许在不改变参数数量的情况下动态权衡计算成本和生成质量。

  5. RESEARCH · CL_145738 ·

    VideoRAE 利用 VFM 特征改进视频生成

    研究人员推出 VideoRAE,这是一种新颖的表示自编码器,旨在增强视频生成模型。该系统利用了 V-JEPA 2 和 VideoMAEv2 等冻结的视频基础模型 (VFM) 的特征,将它们压缩成适合生成任务的紧凑潜在表示。VideoRAE 同时支持用于扩散 Transformer 的连续潜在表示和用于自回归模型的离散标记,在 UCF-101 数据集上展示了最先进的性能,并且比现有方法收敛更快。

  6. TOOL · CL_152126 ·

    VideoRAE 利用冻结的基础特征增强生成式视频模型

    研究人员推出 VideoRAE,这是一种新颖的表示自编码器,旨在增强生成式视频建模。与专注于像素级重建的传统方法不同,VideoRAE 利用来自 V-JEPA 2 和 VideoMAEv2 等冻结视频基础模型的多尺度分层特征。这种方法可以创建紧凑、有利于生成的潜在空间,支持 Diffusion Transformers 的连续潜在变量和自回归模型的离散标记。实验表明,VideoRAE 实现了最先进的重建质量,并且比现有的自编码器基线收…

  7. RESEARCH · CL_79483 ·

    新框架增强关键应用中AI模型的鲁棒性

    研究人员开发了一个名为时空边界传播(STBP)的新框架,以改进用于自动驾驶和医学成像等安全关键应用的神经网络的验证。该方法使用更真实的时空约束来模拟对抗性扰动,与现有技术相比,可以实现更精确的近似和更好的鲁棒性保证。该框架还引入了ST-Bench,这是一个旨在系统评估这些领域可验证鲁棒性的新基准。

  8. TOOL · CL_15602 ·

    CEZSAR方法利用对比学习推进零样本动作识别

    研究人员推出了一种用于零样本动作识别的新方法CEZSAR,该方法利用对比学习来弥合文本描述与视觉表示之间的语义鸿沟。该方法将视频及其对应的自然语言描述编码到共享的嵌入空间中。为了增强训练,CEZSAR采用自动负采样程序来生成不成对的数据,有效地用不相关的视觉和文本元素扩充数据集。该方法在UCF-101和Kinetics-400数据集上取得了最先进的性能。