video diffusion transformers
PulseAugur coverage of video diffusion transformers — every cluster mentioning video diffusion transformers across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
GroupVideo框架生成多身份定制化视频
研究人员开发了GroupVideo,一个旨在生成包含多个不同身份的定制化视频的新框架。该方法解决了当前方法在处理多个人物时出现的身份混淆和动作不自然等局限性。GroupVideo利用多模态身份对齐,结合多张人脸图像的视觉编码和语义感知器,以确保动作自然和强大的身份参考。该框架还包括一个ID定位模块和特定的损失函数,以改善面部区域的聚焦和训练效率。为了支持进一步研究,已整理了一个包含20,000个视频的数据集,实验表明GroupVide…
-
新方法通过优化注意力机制加速文本到视频生成 · 跟踪4个来源
研究人员开发了新的方法来加速文本到视频生成,目前该过程受到大型Transformer模型中注意力机制的计算需求的瓶颈限制。Apple的CalibAtt和来自arXiv的HeadCast框架提出了无需训练的方法,可以识别并跳过可忽略的token-to-token连接,从而实现显著的加速。FVAttn是另一个无需训练的系统,它通过动态迁移注意力头来解决多GPU设置中的工作负载不平衡问题,在保持视频质量的同时实现了显著的推理加速。
-
Kaleido 通过新颖的协同设计加速视频扩散 Transformer · 跟踪 2 个来源
研究人员开发了 Kaleido,一种新颖的算法-硬件协同设计方法,用于加速视频扩散 Transformer (vDiTs)。该方法利用 vDiTs 潜在空间中的时空相关性,而 vDiTs 由于其自注意力机制而计算量巨大。Kaleido 引入了一种逐通道复用算法,可在保持高生成质量的同时减少冗余计算,实现了超过 17 dB 的提升。相关的硬件加速器设计有可重构处理单元和专用数据调度器,以有效地处理算法的稀疏性和数据访问模式。评估表明,与…
-
HyperVAttention 提升视频扩散 Transformer 效率
研究人员开发了 HyperVAttention (HVA),一个旨在提高视频扩散 Transformer (VDiTs) 生成更长视频效率的新框架。HVA 通过采用时空聚类来解决自注意力机制的二次复杂度问题。该框架通过 3D 局部窗口聚类和增量更新 token 聚类的混合方法减少了聚类开销。此外,它通过硬件感知聚类合并提高了 GPU 利用率,从而显著降低了延迟并提高了视频生成保真度。
-
RayPE编码提升视频生成模型的三维感知能力
研究人员开发了RayPE,一种用于视频扩散Transformer的新型位置编码方法,可增强三维感知能力。与使用相机网格坐标的现有方法不同,RayPE结合了6D Plucker坐标来捕捉相机射线之间的几何关系。该方法将注意力分数分解为内容和几何项,两者都被发现对性能至关重要。该方法轻量级,为现有模型增加的参数不到0.1%,并在相机可控性、帧间三维一致性以及整体视频质量方面取得了改进。
-
研究人员通过可编辑的时间和交互式控件增强视频扩散 Transformer
两篇新研究论文介绍了增强视频扩散 Transformer 的控制和交互性的方法。第一篇论文提出了一种时间控制方法,可以在不改变核心架构的情况下,对预训练模型中的运动速度和时间动态进行显式编辑。第二篇论文介绍了 Real-Time AttentionBender,这是一个能够对视频扩散 Transformer 的内部组件进行细粒度、交互式操作的工具,为艺术家提供了对生成过程更深入的理解和创作自主权。
-
PARE方法通过自适应路由提高视频生成效率
研究人员推出了一种新颖的方法PARE,用于提高视频扩散 Transformer (DiTs) 的计算效率。PARE通过结构感知剪枝和输入自适应路由联合压缩模型宽度和深度,以解决DiTs的高计算需求。该系统根据注意力头的空间或时间作用智能地剪枝注意力头,并采用轻量级路由器根据去噪时间步和视觉内容动态选择要执行的块。在Wan2.1-14B数据集上进行图像到视频和文本到视频生成的实验表明,PARE在保持视频质量的同时显著降低了每步计算量。