PulseAugur
实时 11:40:05
English(EN) HTTM: Head-wise Temporal Token Merging for Faster VGGT

新的 HTTM 方法将 3D 重建 Transformer 加速 7 倍

研究人员开发了面部时间令牌合并 (HTTM) 技术,这是一种旨在加速视觉几何基础 Transformer (VGGT) 模型的新颖技术。VGGT 是一个开创性的 3D 场景重建模型,能够单次通过推断相机姿态、深度和几何。然而,其全局注意力机制为大规模重建带来了延迟瓶颈。HTTM 通过基于单个注意力头合并令牌来解决此问题,保留特征独特性并利用时空相关性,在对性能影响最小的情况下将推理速度提高了七倍。 AI

影响 该方法可以显著加快 3D 场景重建任务的速度,从而实现更复杂和更大规模的应用。

排序理由 这是一篇详细介绍加速现有模型新方法的论文。[lever_c_demoted from research: ic=1 ai=1.0]

在 arXiv cs.CV 阅读 →

AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →

新的 HTTM 方法将 3D 重建 Transformer 加速 7 倍

报道来源 [1]

  1. arXiv cs.CV TIER_1 English(EN) · Weitian Wang, Lukas Meiner, Rai Shubham, Cecilia De La Parra, Akash Kumar ·

    HTTM:用于更快VGGT的逐头时序令牌合并

    arXiv:2511.21317v2 Announce Type: replace Abstract: The Visual Geometry Grounded Transformer (VGGT) marks a significant leap forward in 3D scene reconstruction, as it is the first model that directly infers all key 3D attributes (camera poses, depths, and dense geometry) jointly …