PulseAugur
实时 10:41:37
English(EN) Versatile Video Representation via Feed-Forward 2D Gaussian Splatting Tokenization

高斯视频Transformer通过2DGS分词推进视频表示

研究人员开发了高斯视频Transformer(GVT),一个利用前馈式二维高斯泼溅(2DGS)分词方案的创新视频表示框架。该方法通过根据信息内容动态分配渲染权重来增强空间适应性,并通过避免每视频优化来提高泛化能力。GVT还采用高斯集合划分策略来分离静态和动态内容,从而实现更紧凑的表示。在视频重建、动作识别、压缩和生成任务上的评估表明,在重建和压缩方面取得了最先进的性能,在其他领域也取得了有竞争力的结果。 AI

影响 引入了一种新颖的视频表示分词方法,提高了多种视频任务的效率和性能。

排序理由 详细介绍视频表示新方法的学术论文。[lever_c_research降级:ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

高斯视频Transformer通过2DGS分词推进视频表示

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Zhenghao Chen, Zicong Chen, Lei Liu, Yiming Wu, Dong Xu ·

    通过前馈式二维高斯溅射标记化实现多功能视频表示

    arXiv:2508.11183v2 Announce Type: replace Abstract: Recent video representation methods that rely on fixed-grid, patch-wise tokenization often exhibit limited versatility.Spatially, uniformly allocating a fixed number of tokens often leads to over-encoding in low-information regi…