研究人员开发了 WaveZip,一个旨在提高大型视觉语言模型 (LVLM) 处理长视频效率的新框架。与仅在空间域压缩令牌的先前方法不同,WaveZip 在联合信号频率域中运行。它利用离散小波变换 (DWT) 将时间冗余与空间显著性分离,从而能够更精确地分配计算资源。这种方法实现了显著的令牌压缩,在性能损失最小的情况下实现了 10 倍的缩减,并且可以在没有特定任务训练的情况下集成到现有的 LVLM 中。 AI
影响 WaveZip 的小波驱动方法为压缩视频令牌提供了一种新颖的方法,有望使 LVLM 更有效地处理长格式视频内容。
排序理由 该项目是一篇研究论文,详细介绍了一种提高人工智能模型效率的新技术方法。[lever_c_demoted from research: ic=1 ai=1.0]
- 1D DWT
- 2D DWT
- alphaXiv
- arXiv
- CatalyzeX
- DagsHub
- Gotit.pub
- Hugging Face
- Large Vision-Language Models
- ScienceCast
- WaveZip
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →