Wan2.1-T2V-1.3B
PulseAugur coverage of Wan2.1-T2V-1.3B — every cluster mentioning Wan2.1-T2V-1.3B across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
清华大学和香港科技大学发布实时流媒体视频编辑器LiveEdit
清华大学和香港科技大学的研究人员开发了LiveEdit,一个实时流媒体视频编辑框架。该系统以块的形式处理连续视频输入,在每个块上进行4步推理,实现12.66 FPS。LiveEdit通过采用三阶段蒸馏过程和自回归掩码缓存来避免对视频静态部分进行冗余计算,从而保持编辑区域的准确性和未更改区域的一致性。
-
DUET模型在视频生成中协调质量与多样性
研究人员开发了DUET,一种新颖的两步视频生成方法,它结合了轨迹级和分布级蒸馏技术。DUET利用两个专业专家:一个用于高噪声阶段以建立多样化的结构,另一个用于低噪声阶段以完善外观细节。这种方法旨在克服现有方法固有的质量-多样性权衡问题。增强版DUET+在保持结构多样性的同时,进一步提高了整体质量。
-
DUET模型在视频生成中协调质量与多样性
研究人员推出了一种新颖的视频生成方法DUET,该方法使用扩散模型,旨在克服当前几步蒸馏方法固有的质量-多样性权衡问题。DUET采用双专家系统,一个专家专注于高噪声步骤以实现结构多样性,另一个专家专注于低噪声步骤以实现外观质量。这种专家的独立训练避免了复杂的优化问题。增强版DUET+在保持多样性优势的同时,进一步提高了质量。
-
CachedSearch 通过新颖的缓存加速视频扩散模型搜索
研究人员开发了 CachedSearch,一种新颖的、无需训练的方法,用于加速视频扩散模型的测试时搜索。该技术通过积极缓存中间结果,显著降低了生成高质量视频输出的计算成本,使每次运行速度提高 2-3 倍,而质量没有明显下降。CachedSearch 通过缓存探索候选结果,然后仅以完整计算重新生成最佳结果,从而在降低成本的同时捕获了完整搜索超过 94% 的收益。该方法已被证明在各种模型尺寸和架构(包括 Wan、LTX、CogVideoX…
-
新框架增强视频扩散模型的物理一致性
研究人员开发了一个名为VPT的新微调框架,以增强视频扩散模型的物理一致性。该框架通过引入一个角色感知信号来解决现有方法的局限性,该信号将实体分为代理、受控对象、被动对象和背景,从而能够更细致地模拟物理角色。VPT还采用了一种模态解耦去噪策略,为视觉和辅助通道分配独立的噪声水平,这充当了软约束以减轻推理错误。实验表明,VPT在保持视觉质量的同时显著提高了物理一致性,在VideoPhy和VideoPhy-2基准测试中取得了显著的进步。
-
DreamForge-World 0.1 预览在消费级 GPU 上实现实时交互式模拟
研究人员推出了 DreamForge-World 0.1 Preview,这是一个专为实时交互式模拟设计的 foundational world model。该模型改编了现有的视频生成架构,例如 LongLive 1 和 Wan2.1-T2V-1.3B,并借鉴了 Matrix-Game 系列的 residual action pathway。DreamForge-World 优先考虑低计算量适应性,使其能够在 RTX 4090 等消费…
-
新框架和基准加速交互式视频世界模型
研究人员开发了加速交互式视频世界模型的新方法,该模型根据用户摄像机移动生成视频内容。“Light Interaction”通过自适应管理上下文和使用去噪缓存提供了一种无需训练的方法,实现了高达 2.59 倍的速度提升。另外,“minWM”框架提供了一个开源管道,用于将现有的视频扩散模型转换为实时交互式世界模型。此外,还引入了一个名为“WBench”的新基准,用于在多个维度上全面评估这些交互式视频世界模型。