PulseAugur
实时 05:18:34
English(EN) WaveZip: Wavelet-Driven Space-Time Decoupling for Video Token Condensation

WaveZip 框架通过小波压缩增强 LVLM 视频处理能力

研究人员开发了 WaveZip,一个旨在提高大型视觉语言模型 (LVLM) 处理长视频效率的新框架。与仅在空间域压缩令牌的先前方法不同,WaveZip 在联合信号频率域中运行。它利用离散小波变换 (DWT) 将时间冗余与空间显著性分离,从而能够更精确地分配计算资源。这种方法实现了显著的令牌压缩,在性能损失最小的情况下实现了 10 倍的缩减,并且可以在没有特定任务训练的情况下集成到现有的 LVLM 中。 AI

影响 WaveZip 的小波驱动方法为压缩视频令牌提供了一种新颖的方法,有望使 LVLM 更有效地处理长格式视频内容。

排序理由 该项目是一篇研究论文,详细介绍了一种提高人工智能模型效率的新技术方法。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

WaveZip 框架通过小波压缩增强 LVLM 视频处理能力

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Yuhui Zeng, Wang Chen, Jinfa Huang, Tianyu Xie, Yongdong Luo, Jiayi Ji, Xiawu Zheng, jiebo Luo ·

    WaveZip:小波驱动的时空解耦用于视频令牌压缩

    arXiv:2607.23265v1 Announce Type: new Abstract: Existing Large Vision-Language Models (LVLMs) struggle with long-form video understanding due to the quadratic computational cost of visual tokens. While recent efficient methods attempt to compress tokens via hard pruning or unifor…