Video Diffusion Models
PulseAugur coverage of Video Diffusion Models — every cluster mentioning Video Diffusion Models across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
DreamHand框架重新利用视频扩散模型进行3D手部运动恢复
研究人员开发了DreamHand,一个新框架,它重新利用视频扩散模型来改进从自我中心视频中恢复3D手部运动。该方法通过使用确定性几何编码器来解决物体遮挡和手部离开画面等挑战。DreamHand在多个基准测试中取得了最先进的成果,显著降低了度量手部轨迹恢复的误差,尤其是在考虑手部不可见的情况下。
-
AvatarDynamizer 将静态 3D 化身转换为动态 4D 版本
研究人员开发了 AvatarDynamizer,这是一种新颖的生成方法,旨在将静态 3D 化身转换为动态、逼真且多视图一致的 4D 化身。该方法通过将姿态相关的表面动力学嵌入到动态纹理贴图中,克服了现有方法的局限性,使其能够与预先训练的视频扩散模型兼容。该系统将这些纹理解码为 3D 高斯以进行渲染,并收集了一个新的大规模数据集来支持其训练和评估。
-
AnyTalk 使用视频扩散模型进行 3D 语音动画
研究人员开发了 AnyTalk,一种为任意角色创建 3D 语音动画的新方法,无需现有的动画数据。该方法通过一种称为特定角色微调(CsF)的过程来调整预训练的视频扩散模型。然后,该方法从合成的说话头视频中估计混合形状参数,以生成唇形同步动画,从而大大减少了手动工作量。还开发了一个名为 AnyTalk_RT 的实时版本,以实现更快的性能。
-
新的视频世界模型以更少的参数外推物理定律
研究人员开发了潜在动力学推理(LDR),一种新颖的视频世界模型方法,将运动学动力学集成到结构化潜在空间中。与现有的视频扩散模型相比,该方法允许模型以显著更少的参数和更快的推理时间,在外推物理定律方面超越其训练数据。LDR在物理基准测试中得到了验证,证明了在分布内和分布外场景之间的误差差距得到了实质性减少,并且即使在训练数据发生严重偏移的情况下也显示出泛化能力。
-
新的AI方法解决了视频反射的移除和生成问题 · 追踪4个来源
研究人员开发了处理视频反射的新颖方法,解决了移除不需要的反射和生成逼真镜面反射的挑战。一种名为S2R-Synthesis的方法使用基于物理的模拟来创建成对的反射和无反射视频,从而能够训练S2R-Removal,这是一个基于扩散的视频去反射模型,实现了最先进的性能和快速推理。同时,MirrorWorld框架通过语义关系蒸馏和几何变换对齐来模拟场景到镜面的关系,解决了镜面反射的生成问题,提高了反射重建质量,并为该任务树立了新的基准。
-
新的 DAR 方法使视频模型能够渲染 4D 场景
研究人员开发了 DAR,这是一种新颖的方法,使预训练的视频扩散模型能够充当 4D 渲染器。该方法使用动画网格、相机轨迹和参考图像来约束这些模型,从而实现考虑相机运动和内部对象动画的场景生成。DAR 投影一个神经 4D G-缓冲区,其中包含跟踪、世界位置和法线信息,然后通过加宽的控制适配器将其集成到模型中。在 DAR-4D 基准测试上的评估表明,与 Wan2.2-Depth 等现有方法相比,PSNR、SSIM 和 LPIPS 有显著提高。
-
AgentHOI框架利用多智能体推理生成人体-物体交互视频
研究人员推出AgentHOI,一个用于生成人体-物体交互视频的新颖框架。该系统采用多智能体推理来弥合文本描述与动作的物理执行之间的差距,超越了依赖显式运动控制的现有方法。AgentHOI通过隐式对齐策略增强了文本到运动的理解,能够在推理过程中无需显式运动输入即可合成逼真的交互。该框架在交互自然性、物体外观保持性和遵循复杂文本指令方面取得了显著改进。
-
MagicPrompt 为视频生成提供超轻量级调优
研究人员推出 MagicPrompt,一个旨在提高视频生成模型效率的新框架。该方法采用注意力嵌入式提示调优(Attention-Embedded Prompt Tuning),使用的参数比传统微调少得多,同时保留了模型的预训练知识。此外,MagicPrompt 还结合了双空间奖励反馈优化(Dual-Space Reward Feedback Optimization)来稳定条件引导任务的训练。实验表明,MagicPrompt 以不到 …
-
InverseCrafter框架可在无需VDM微调的情况下实现高效视频重捕获
研究人员推出了一种新颖的框架InverseCrafter,用于在无需对预训练视频扩散模型(VDM)进行大量微调的情况下生成视频的新视角。该方法将视频重捕获视为潜在空间中的逆问题,利用轻量级的潜在掩码编码器来避免计算成本高昂的训练和灾难性遗忘问题。InverseCrafter通过以最小的额外推理成本保留原始VDM的生成能力,实现了高效、高保真的视频修复和编辑。
-
新研究解决扩散模型效率和应用问题 · 追踪8个来源
近期研究探索了扩散模型的进展,重点在于提高其效率和在各个领域的适用性。FlashDiff 引入了自适应区域执行和调度,以降低图像、视频和音频生成的服务延迟并提高吞吐量。视频扩散模型中存在“序列性差距”挑战,即性能会随着因果链的延长而下降,这表明需要改进序列计算。其他工作提出了使用检索增强扩散 Transformer 进行异步时间序列预测的 ReDiTT,并探索了无需重新训练即可提高扩散模型多样性的方差校正时间偏移。此外,Singula…
-
新研究探索使用扩散模型进行先进的视频生成和处理
研究人员正在探索使用扩散模型来改进视频生成和处理的先进技术。一种方法是将状态空间模型(SSM)与视频扩散模型集成,以提高效率并处理更长的序列,在内存使用和性能方面优于基于注意力的方法。其他研究则侧重于通过使用扩散 Transformer 和自适应来提高视频重新照明中的时间一致性,并通过利用预训练的视频扩散模型从视频中重建 4D 手部运动。此外,还在开发用于高效视频恢复和鲁棒点跟踪的方法,方法是调整扩散模型的特征和训练策略。
-
NaviCache 通过新颖的自校准技术加速视频生成
研究人员推出了一种名为 NaviCache 的新颖方法,旨在通过解决视频扩散模型 (VDM) 的计算成本来加速视频生成。与依赖离线校准或瞬时近似的先前方法不同,NaviCache 采用了一种测试时间自校准技术。它将特征演化建模为惯性导航系统 (INS) 问题,自适应地跟踪特征变化及其潜在漂移,从而实现有误差界限的计算跳过。在 HunyuanVideo 和 Open-Sora 等数据集上的实验表明,NaviCache 提高了计算跳过的准…
-
新的REINS方法在无需重新训练的情况下引导视频扩散模型实现安全
研究人员开发了一种名为REINS(REpresentation-space INference-time Safety steering,表示空间推理时安全引导)的新型无需训练的方法,用于对齐视频扩散模型并防止生成不安全内容。该技术通过在推理时引导模型的内部表示来实现,而无需昂贵的安全微调。REINS识别模型隐藏状态中区分安全与不安全内容的特定方向,并通过将此方向添加到中间层,以最小的计算开销将有害生成重定向到安全替代方案。该方法已在…
-
新研究提升3D高斯溅射的效率和编辑能力
研究人员正在推进3D高斯溅射(3DGS)技术,以提高效率、准确性和编辑能力。新方法侧重于结合不确定性量化以实现更好的主动视图选择和场景重建,开发可证明的核集构造用于压缩,并增强具有一致性增强框架的以自我为中心的场景生成。此外,进展包括大规模场景的结构感知调度、动态场景的运动方差引导时间注意力、鲁棒的部件级编辑以及用于纹理操纵的内在分解。
-
新的SARA方法提升视频扩散模型对齐度
研究人员开发了SARA,一种通过将监督集中在视频的语义相关部分来改进视频扩散模型的新方法。该方法利用文本条件显著性来确定视频生成过程中哪些令牌对对于与提示对齐最重要。在评估中,SARA与现有方法相比,在文本对齐和运动质量方面均有所提高。
-
Rein3D框架使用扩散模型生成一致的3D室内场景
研究人员开发了Rein3D,一个用于生成详细3D室内场景的新框架。该系统结合使用3D高斯溅射和视频扩散模型来重建完整的360度环境。Rein3D通过提高全局一致性和推断缺失的几何形状,克服了现有方法的局限性,并产生了照片级的逼真效果。
-
新基准 YoCausal 测试视频模型因果理解能力
研究人员推出 YoCausal,这是一个旨在评估视频扩散模型(VDMs)因果理解能力的新型基准。该基准受认知科学原理启发,利用时间反转的真实世界视频创建自然的反事实样本。YoCausal 包含两个层面:反向惊喜指数(RSI)用于衡量时间感知能力,因果认知指数(CCI)则使用视觉语言模型(VLM)来区分真正的因果推理与单纯的时间模式过拟合。对 13 个最先进的 VDM 的评估表明,它们感知时间流向的能力与真正的因果认知之间存在显著差距,…
-
DexSIM框架支持实时灵巧手-物体模拟
研究人员开发了DexSIM,一个使用统一因果视频扩散模型进行灵巧手-物体交互实时模拟的新框架。该系统通过两阶段训练过程,改进了长期空间一致性和记忆力,解决了现有方法的局限性。DexSIM在像素相似度、运动保真度和手部投影精度方面取得了卓越的性能,实现了手部动作迁移等新应用,运行速度达到15.24 FPS。
-
新研究提升视频生成控制力和效率
研究人员正在开发新方法来改进视频生成模型,重点关注控制、效率和质量。一种名为LA-LQR的方法使用最优控制来引导视频生成模型,在保持视觉保真度的同时减少不期望的内容。另一个研究领域是通过蒸馏和低比特量化来压缩大型视频扩散模型(如Wan2.2),使其更易于部署。此外,新的框架正在出现,为视频生成提供显式的3D控制和感知,超越2D投影,以更好地捕捉复杂的场景动态和人物运动。
-
新的PREX框架实现了忠实的4D视频编辑
研究人员开发了PREX,一个新颖的、用于忠实4D视频编辑的框架,它解决了在合成新内容的同时保留原始区域的挑战。该方法识别并纠正了现有扩散模型中的“证据-角色不匹配”问题,该问题可能导致重影和不稳定的外推。PREX将视频体积分解为不同的角色(Preserve, Reveal, Expand),并使用一个区域感知适配器,该适配器带有校准的置信度提示,并且无需配对的编辑视频即可进行训练。还引入了一个新的基准PREBench来评估这些能力。