Wan2.1-14B
PulseAugur coverage of Wan2.1-14B — every cluster mentioning Wan2.1-14B across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
RoLA注意力机制提升了用于视频生成的Diffusion Transformer的效率
研究人员开发了RoLA,一种新颖的注意力机制,旨在提高用于视频生成的Diffusion Transformer(DiTs)的效率。该新方法通过结合稀疏局部分支和压缩全局分支来解决标准自注意力的二次缩放问题,特别克服了与3D旋转位置嵌入(RoPE)的兼容性挑战。RoLA将RoPE集成在低秩特征图之外,实现了真正的跨token聚合,无需额外的位置参数,并实现了线性时间的全局分支。实验表明,RoLA在90%的稀疏度下保持了生成质量,并在Wa…
-
新的PhyS框架将物理先验知识蒸馏到流式世界模型中
研究人员开发了PhyS,一个新颖的三阶段框架,旨在为流式世界模型注入物理一致性。该框架通过构建一个包含120,000个真实世界物理交互视频的大型数据集PhyS-120K来训练一个物理感知教师模型,从而解决了当前方法的局限性。然后,PhyS框架将这些物理先验知识蒸馏到一个更小的因果模型中,该模型通过在线强化学习和一种称为时间信用路由的技术进行进一步优化,以确保物理上合理的长期预测。
-
新方法LoSA和HEART加速视频扩散Transformer
研究人员开发了两种新方法LoSA和HEART,通过优化稀疏注意力机制来加速视频扩散Transformer。LoSA通过识别和移除冗余的注意力交互,在无需重新训练的情况下保持近乎无损的保真度,从而实现显著的加速。HEART利用注意力中的头部异质性,在去噪步骤中重用稳定的稀疏掩码,并根据误差敏感性校准阈值,以进一步提高效率。这两种方法都旨在改善视频生成任务的速度-质量权衡,而无需重新训练模型。
-
新的RACER控制器提高了扩散模型的速度和可靠性 · 跟踪2个来源
研究人员开发了RACER,一种新的闭环控制器,旨在提高扩散模型的效率和可靠性。与盲目信任预测的先前方法不同,RACER分析预测之间的一致性,以确定何时以及在多大程度上信任它们。这种方法允许在不牺牲质量的情况下更积极地加速扩散采样,从而在SD3.5-Large、FLUX.1-dev、Wan2.1-14B和HunyuanVideo等各种模型中实现更快的生成速度。
-
CachedSearch 通过新颖的缓存加速视频扩散模型搜索
研究人员开发了 CachedSearch,一种新颖的、无需训练的方法,用于加速视频扩散模型的测试时搜索。该技术通过积极缓存中间结果,显著降低了生成高质量视频输出的计算成本,使每次运行速度提高 2-3 倍,而质量没有明显下降。CachedSearch 通过缓存探索候选结果,然后仅以完整计算重新生成最佳结果,从而在降低成本的同时捕获了完整搜索超过 94% 的收益。该方法已被证明在各种模型尺寸和架构(包括 Wan、LTX、CogVideoX…
-
新的DigenRL框架通过解耦强化学习加速扩散式生成大语言模型 · 跟踪3个来源
研究人员开发了DigenRL,一个解耦强化学习框架,旨在提高基于扩散的生成式大语言模型的效率。该新框架通过实现灵活的资源分配和兼容异构GPU来解决现有系统的局限性。DigenRL引入了生成轴流水线(GAP)和时间步长并行(TSP)等新技术,以改进rollout和训练之间的流水线操作,并结合了弹性Trainer-Assisted Generation(TAG)方法。实验表明,DigenRL显著提高了吞吐量,与当前最先进的系统相比,最高可…
-
新的Steady-Forcing框架改进了长时域自然视频生成 · 已追踪2个来源
研究人员开发了Steady-Forcing,一个旨在提高自回归扩散模型生成的长时域自然视频质量的新框架。该方法通过结合持久视觉锚点(V-Sink)和指数移动平均运动记忆(EMA-Sink)来解决场景布局漂移和运动抑制等常见问题。此外,该框架还纳入了块相对时间编码、周期性缓存净化以及从Wan2.1-14B教师模型进行蒸馏。评估表明,Steady-Forcing在扩展视频序列中增强了背景一致性和运动连续性,优于现有基线。
-
PARE方法通过自适应路由提高视频生成效率
研究人员推出了一种新颖的方法PARE,用于提高视频扩散 Transformer (DiTs) 的计算效率。PARE通过结构感知剪枝和输入自适应路由联合压缩模型宽度和深度,以解决DiTs的高计算需求。该系统根据注意力头的空间或时间作用智能地剪枝注意力头,并采用轻量级路由器根据去噪时间步和视觉内容动态选择要执行的块。在Wan2.1-14B数据集上进行图像到视频和文本到视频生成的实验表明,PARE在保持视频质量的同时显著降低了每步计算量。