Wan2.1-1.3B
PulseAugur coverage of Wan2.1-1.3B — every cluster mentioning Wan2.1-1.3B across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
AI进展解决视频生成一致性和速度问题
近期在AI驱动的视频生成领域的研究侧重于提高一致性和效率。ContextAnyone通过将参考图像视为共享扩散Transformer中的显式锚点来解决角色一致性问题,防止嘈杂的视频特征影响身份保持。FlashRender通过表示对齐和均值流目标来加速生成式视频渲染,以显著降低的采样成本实现高质量合成。Temporal Context Routing (TCR) 通过精确对齐脚本时间与时间轴来增强脚本驱动的音频-视频生成,大幅减少镜头切…
-
新方法LoSA和HEART加速视频扩散Transformer
研究人员开发了两种新方法LoSA和HEART,通过优化稀疏注意力机制来加速视频扩散Transformer。LoSA通过识别和移除冗余的注意力交互,在无需重新训练的情况下保持近乎无损的保真度,从而实现显著的加速。HEART利用注意力中的头部异质性,在去噪步骤中重用稳定的稀疏掩码,并根据误差敏感性校准阈值,以进一步提高效率。这两种方法都旨在改善视频生成任务的速度-质量权衡,而无需重新训练模型。
-
新的Causal-rCM配方加速了自回归视频扩散
研究人员推出了一种新颖的自回归视频扩散蒸馏开放配方Causal-rCM。该框架统一了teacher-forcing和self-forcing范式,以增强流式视频生成和交互式世界模型。Causal-rCM利用连续时间一致性模型和自定义FlashAttention-2内核,实现了比以往方法快10倍的收敛速度。该方法在视频生成方面展示了最先进的性能,一个蒸馏的2步因果Wan2.1-1.3B模型在使用最少采样步数的情况下,在VBench-T2…
-
新基准和框架推动视频世界建模发展
研究人员推出了“ImageTime”,这是一个旨在评估图像生成模型理解和表示时间变化能力的新基准。该基准通过要求模型生成一个动作的四个有序关键状态来评估时空一致性,超越了单一图像质量指标。此外,还开发了一个名为BiWM的新框架,利用双向自回归来推进开源交互式视频世界模型,旨在提高生成质量和推理速度。另一篇论文提出了一种用于视频世界模型的“潜在空间记忆”,将场景信息直接存储在扩散潜在空间中,从而显著加快生成速度并减小内存占用。