PulseAugur
实时 15:25:36
实体 SsV2

SsV2

PulseAugur coverage of SsV2 — every cluster mentioning SsV2 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 4
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 4
层级分布 · 90 天
主题
关系
情绪 · 30 天

2 天有情绪数据

最近 · 第 1/1 页 · 共 4 条
  1. RESEARCH · CL_147767 ·

    新的类Mamba注意力模型VideoSEMA提升视频理解性能

    研究人员推出VideoSEMA,这是一种新颖的类Mamba注意力模型,专为高效可扩展的视频理解而设计。该模型采用分时空注意力机制,在其空间分量中结合了局部窗口注意力和全局平均,并在其时间分量中使用了softmax时间注意力。与现有的视觉Transformer和Mamba模型相比,VideoSEMA在K400和SSv2等基准数据集上表现出优越的性能,尤其是在图像分辨率增加时准确率的平稳下降。该研究还强调了通过扩张或稀疏时间注意力将Vid…

  2. TOOL · CL_150700 ·

    HyperGS 通过快速、可泛化的高斯预测推进视频表示

    研究人员开发了 HyperGS,这是一种新颖的前馈方法,可以直接在单次传递中预测视频的高斯表示,无需进行每视频优化。该方法在保持重建质量并泛化到更高分辨率和分布外视频的同时,将编码和解码速度提高了几个数量级。HyperGS 利用了因子化的时空 Transformer 和基于查询的 Transformer,并结合了动态秩几何正则化器来稳定训练并防止崩溃。该系统在 K400、SSv2 和 UCF101 等基准数据集上实现了显著的速度提升并提高了性能。

  3. RESEARCH · CL_141268 ·

    HyperGS 通过更快、更具泛化性的预测推进高斯视频表示

    研究人员开发了 HyperGS,一种使用高斯泼溅法进行视频表示的新型前馈方法。与之前需要逐视频优化的方法不同,HyperGS 在单次传递中直接预测高斯表示,显著加快了编码和解码速度。该系统采用时空 Transformer 提取视频 token,并使用基于查询的 Transformer 生成高斯参数,通过动态几何正则化器解决训练退化问题。该方法实现了数量级的编码加速,可泛化到更高分辨率,并提高了标准基准上的重建质量。

  4. RESEARCH · CL_02900 ·

    将视频推理建立在物理信号之上

    研究人员开发了一个新的基准来评估物理视频理解能力,超越了简单的事件识别,以评估模型在时间和空间上精确定位事件的能力。该基准包含来自四个来源的视频片段,涵盖六个物理领域,并在不同的提示家族和输入条件下测试模型。研究结果表明,虽然基于物理的推理是最强的,但空间定位仍然是一个重大挑战,这表明未来的基准应包括物理上可定位、提示感知和扰动感知的诊断。