Wan2.1-T2V-1.3B
PulseAugur coverage of Wan2.1-T2V-1.3B — every cluster mentioning Wan2.1-T2V-1.3B across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
CachedSearch 通过新颖的缓存加速视频扩散模型搜索
研究人员开发了 CachedSearch,一种新颖的、无需训练的方法,用于加速视频扩散模型的测试时搜索。该技术通过积极缓存中间结果,显著降低了生成高质量视频输出的计算成本,使每次运行速度提高 2-3 倍,而质量没有明显下降。CachedSearch 通过缓存探索候选结果,然后仅以完整计算重新生成最佳结果,从而在降低成本的同时捕获了完整搜索超过 94% 的收益。该方法已被证明在各种模型尺寸和架构(包括 Wan、LTX、CogVideoX…
-
新框架增强视频扩散模型的物理一致性
研究人员开发了一个名为VPT的新微调框架,以增强视频扩散模型的物理一致性。该框架通过引入一个角色感知信号来解决现有方法的局限性,该信号将实体分为代理、受控对象、被动对象和背景,从而能够更细致地模拟物理角色。VPT还采用了一种模态解耦去噪策略,为视觉和辅助通道分配独立的噪声水平,这充当了软约束以减轻推理错误。实验表明,VPT在保持视觉质量的同时显著提高了物理一致性,在VideoPhy和VideoPhy-2基准测试中取得了显著的进步。
-
DreamForge-World 0.1 预览在消费级 GPU 上实现实时交互式模拟
研究人员推出了 DreamForge-World 0.1 Preview,这是一个专为实时交互式模拟设计的 foundational world model。该模型改编了现有的视频生成架构,例如 LongLive 1 和 Wan2.1-T2V-1.3B,并借鉴了 Matrix-Game 系列的 residual action pathway。DreamForge-World 优先考虑低计算量适应性,使其能够在 RTX 4090 等消费…
-
新框架和基准加速交互式视频世界模型
研究人员开发了加速交互式视频世界模型的新方法,该模型根据用户摄像机移动生成视频内容。“Light Interaction”通过自适应管理上下文和使用去噪缓存提供了一种无需训练的方法,实现了高达 2.59 倍的速度提升。另外,“minWM”框架提供了一个开源管道,用于将现有的视频扩散模型转换为实时交互式世界模型。此外,还引入了一个名为“WBench”的新基准,用于在多个维度上全面评估这些交互式视频世界模型。