研究人员开发了一种新的训练后量化方法CTOAC,用于视觉状态空间模型(VSSD),这是Mamba架构在图像处理方面的扩展。研究发现,激活量化是低比特VSSD性能的关键瓶颈,在代表性输入中存在显著的通道级幅度变化和令牌局部化极端值。CTOAC通过学习每输入通道的裁剪边界来最小化线性层输出的重建损失,而其他操作则保持原始精度。该方法在ImageNet-1K、COCO和ADE20K数据集上的VSSD变体中表现出鲁棒性,在目标检测和分割任务中保持了准确性和性能。此外,在RTX 4090上的优化部署实现了比FP32高1.42倍的速度提升。 AI
影响 提高了视觉状态空间模型的效率和性能,可能使其在资源受限的环境中得到更广泛的应用。
排序理由 学术论文,详细介绍了一种优化视觉状态空间模型的新方法。[lever_c_demoted from research: ic=1 ai=1.0]
- ADE20K
- Channel-wise Token-balanced Output-Aware Clipping
- COCO
- CTOAC
- Mamba
- RTX 4090
- Vim
- Visual State Space Duality
- VmambaSCI: Dynamic Deep Unfolding Network with Mamba for Compressive Spectral Imaging
- VSSD-Base
- VSSD-Small
- VSSD-Tiny
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →