PulseAugur
实时 06:20:58
实体 Kinetics-400

Kinetics-400

PulseAugur coverage of Kinetics-400 — every cluster mentioning Kinetics-400 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 6
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/1 页 · 共 6 条
  1. TOOL · CL_219151 ·

    Iwin Transformer 通过交错窗口和卷积解决了 ViT 的复杂性问题

    研究人员推出了一种新颖的层次化视觉Transformer——Iwin Transformer,旨在克服现有视觉Transformer(ViTs)的局限性。这种新架构在一个块内结合了交错窗口注意力和深度卷积,有效降低了注意力机制的二次复杂度。Iwin Transformer 还实现了增强的可扩展性,能够支持在不同分辨率下的微调以及从2D到3D应用的权重迁移。初步结果显示,在ImageNet-1K上的准确率有所提高,在Kinetics-4…

  2. TOOL · CL_191408 ·

    新型Transformer模型实现高效边缘动作识别

    研究人员开发了CoDAT,一种用于边缘设备上高效动作识别的协作双注意力Transformer。该模型采用轻量级双分支注意力机制,结合用于局部特征聚合的空间卷积注意力(SCA)和用于全局上下文的跨步单头注意力(SSHA),显著降低了计算成本。CoDAT还包含一个无参数的TShift模块用于时间建模,实现了跨帧的高效通信。实验表明,CoDAT在各种基准测试中实现了优于现有方法的能耗-准确性平衡,为边缘物联网系统中的实时应用提供了更快的吞吐…

  3. TOOL · CL_183407 ·

    新的知识蒸馏方法增强动作识别模型压缩

    研究人员开发了一种新颖的通道动态知识蒸馏(KD)方法,称为 ASCD KD,以改进大型动作识别模型的压缩。该方法通过动态生成包含语义信息并保留运动细节的自适应样本来解决现有 KD 技术的局限性,而不是依赖于固定输入。此外,它应用了通道蒸馏强度,该强度考虑了不同通道在整个训练过程中不断变化的权重。在 UCF101、Kinetics-400 和 Something-Something-v2 等多个基准上的实验表明,ASCD KD 取得了最先进的性能。

  4. TOOL · CL_154515 ·

    新的视频Transformer模仿灵长类动物的视觉和大脑活动

    研究人员开发了一种受灵长类动物视觉和神经数据启发的、新颖的视频Transformer架构。该模型包含一个稀疏令牌选择模块,以提高效率并模仿生物视觉处理。它还采用了一种分离-融合设计,具有独立的“什么”和“哪里”流,在分类前将它们合并。该模型在标准基准测试中展示了具有竞争力的准确性和推理时间,并显示出与EEG数据改进的大脑-模型相关性,表明其在脑对齐视频理解方面的有效性。

  5. TOOL · CL_121050 ·

    新的EchoRisk数据集旨在早期检测治疗诱导的心脏毒性

    研究人员推出了EchoRisk,这是一个新数据集和基准,旨在早期检测接受治疗的癌症患者的心脏毒性。该数据集源自CARDIOCARE研究,包含来自五个欧洲站点超过400名患者的纵向超声心动图视频。它支持三项任务:估算射血分数、分类左心室功能障碍以及从基线影像预测心脏毒性,初步结果显示在功能评估方面表现强劲,但突出了早期心脏毒性预测仍是一项开放性挑战。

  6. TOOL · CL_15602 ·

    CEZSAR方法利用对比学习推进零样本动作识别

    研究人员推出了一种用于零样本动作识别的新方法CEZSAR,该方法利用对比学习来弥合文本描述与视觉表示之间的语义鸿沟。该方法将视频及其对应的自然语言描述编码到共享的嵌入空间中。为了增强训练,CEZSAR采用自动负采样程序来生成不成对的数据,有效地用不相关的视觉和文本元素扩充数据集。该方法在UCF-101和Kinetics-400数据集上取得了最先进的性能。