3D-RoPE
PulseAugur coverage of 3D-RoPE — every cluster mentioning 3D-RoPE across labs, papers, and developer communities, ranked by signal.
-
新框架BooM-VVT实现无遮挡视频虚拟试穿
研究人员开发了BooM-VVT,一个新颖的无遮挡视频虚拟试穿框架,可增强服装一致性并处理各种试穿任务。该系统采用多阶段训练策略和图像级伪数据,以减少对昂贵视频级数据的需求。它还集成了服装敏感关键帧采样和帧共享3D-RoPE,以改进服装外观捕捉和时空对应。此外,该项目还推出了OmniView,一个大规模多视图数据集,以支持可靠的试穿视频生成。
-
新的AQ3D方法通过自适应查询推进3D实例分割
研究人员推出了一种新颖的3D实例分割方法AQ3D,该方法旨在适应不同大小的场景。与使用固定数量查询的先前方法不同,AQ3D根据场景超点比例实例化查询,从而更灵活地处理小型和大型场景。该系统还采用3D RoPE,使用量化度量坐标进行位置编码,摒弃了学习到的、有界的查找表。实验表明,AQ3D在ScanNetV2、ScanNet200和ScanNet++V2数据集上取得了最先进的成果。
-
SCOPE框架提升扩散Transformer在视频注意力方面的效率
研究人员开发了SCOPE,一个新颖的无需训练的稀疏注意力框架,旨在提高扩散Transformer(DiTs)在视频处理中的效率。SCOPE通过采用子空间聚类和在线每头Top-K估计方法来解决自注意力的二次成本问题。这种方法允许更具适应性和细粒度的注意力键选择,在保真度和延迟方面均优于现有方法。在测试中,SCOPE在HunyuanVideo数据集上实现了高达1.99倍的速度提升。
-
新的 RotateAttention 框架加速了 AI 视频生成
研究人员开发了 RotateAttention,一个新颖的混合精度 INT4 FlashAttention 框架,旨在加速使用 3D 旋转位置嵌入 (3D RoPE) 的基于 DiT 的视频生成模型。该框架解决了在线旋转矩阵与 RoPE 协调的挑战,并优化了注意力矩阵 P 的量化。实验表明,RotateAttention 在保持与全精度模型相当的视频生成质量的同时,实现了显著的加速。