PulseAugur
中
实时 11:57:49
实体 Video Diffusion Models

Video Diffusion Models

PulseAugur coverage of Video Diffusion Models — every cluster mentioning Video Diffusion Models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
29
90 天内 29
发布 · 30天
0
90 天内 0
论文 · 30天
28
90 天内 28
层级分布 · 90 天
主题
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 29 条
  1. TOOL · CL_273244 ·

    AI视频生成更好地与人眼视觉皮层对齐

    研究人员开发了一种新方法,通过将视频生成模型的内部表征与人眼视觉皮层活动进行比较来评估模型。他们发现,自回归(AR)视频扩散模型在生成未来视频帧时,比处理观察视频的模型更能与人眼视觉皮层对齐。与用于观察视频重建的低阶区域相比,这种对齐在未来生成中更高阶的视觉皮层区域更为明显。一项人类行为实验进一步支持了这些发现,显示出人们更偏好通过放大与视觉皮层活动更匹配的层来生成的视频。

  2. RESEARCH · CL_271020 ·

    新研究解决了视频扩散模型的效率和安全性问题

    研究人员正在开发新方法来提高视频扩散模型的效率和质量。SplitMoE引入了一种分层架构,以更好地处理视频数据中的语义不平衡,在收敛速度和生成质量方面优于传统方法。PARK通过提高稀疏注意力中块检索的准确性来解决Diffusion Transformers中注意力的二次复杂度问题,从而实现更好的质量-效率权衡。DeCoPrune和Self-Aligned Forcing (SAF) 解决了自回归视频扩散中的挑战,其中DeCoPrune…

  3. RESEARCH · CL_270706 ·

    新研究解决AI中奖励模型的不稳定性和效率问题

    研究人员正在开发新方法来改进用于大型语言模型和扩散模型中的奖励模型的训练和鲁棒性。一种名为“密度感知奖励聚合”(DARA)的方法,通过根据奖励的活动密度对其进行加权来解决多奖励强化学习中不均衡的学习进展问题,从而在工具调用和数学推理等任务上实现更快的收敛。另一个研究重点是缓解奖励模型中的偏好不稳定性,例如使用稀疏自编码器(SAEs)识别和抑制导致矛盾判断的脆弱特征。针对视频理解,已创建了一个新的基准(VURB)和数据集(VUP-35K…

  4. RESEARCH · CL_235689 ·

    DSAQuant框架改进视频扩散模型量化

    研究人员开发了DSAQuant,一个专为视频扩散模型(VDMs)设计的量化感知训练(QAT)新框架。现有的QAT方法在VDMs上表现不佳,尽管能保留语义,但常常会损害视觉细节和清晰度。DSAQuant通过将量化与视频去噪的阶段性相结合来解决这个问题,优化早期步骤以获取结构,优化后期步骤以进行细节重建。实验表明,DSAQuant在激进量化下显著优于当前基线,将VBench分数提高了多达6.60,同时保持了文本-视频对齐。

  5. TOOL · CL_227243 ·

    研究发现:视频扩散模型可有效扩展训练曝光度

    研究人员对专门用于自动驾驶应用的视频扩散模型进行了全面的可扩展性定律分析。他们的研究涵盖了从100万到90亿参数的模型,并在最多5,500小时的驾驶数据上进行了训练,发现与在计算量有限的情况下单纯增加模型大小相比,增加训练曝光度能更有效地显著提高模型性能。然而,更大的模型仍然实现了更低的渐近损失,这表明在拥有足够资源的情况下,模型大小对于最优扩展仍然至关重要。该研究最终训练了一个90亿参数的模型,据报道该模型在nuScenes基准测试…

  6. RESEARCH · CL_229635 ·

    AI进展解决视频生成一致性和速度问题

    近期在AI驱动的视频生成领域的研究侧重于提高一致性和效率。ContextAnyone通过将参考图像视为共享扩散Transformer中的显式锚点来解决角色一致性问题,防止嘈杂的视频特征影响身份保持。FlashRender通过表示对齐和均值流目标来加速生成式视频渲染,以显著降低的采样成本实现高质量合成。Temporal Context Routing (TCR) 通过精确对齐脚本时间与时间轴来增强脚本驱动的音频-视频生成,大幅减少镜头切…

  7. TOOL · CL_212202 ·

    DreamHand框架重新利用视频扩散模型进行3D手部运动恢复

    研究人员开发了DreamHand,一个新框架,它重新利用视频扩散模型来改进从自我中心视频中恢复3D手部运动。该方法通过使用确定性几何编码器来解决物体遮挡和手部离开画面等挑战。DreamHand在多个基准测试中取得了最先进的成果,显著降低了度量手部轨迹恢复的误差,尤其是在考虑手部不可见的情况下。

  8. RESEARCH · CL_212187 ·

    AvatarDynamizer 将静态 3D 化身转换为动态 4D 版本

    研究人员开发了 AvatarDynamizer,这是一种新颖的生成方法,旨在将静态 3D 化身转换为动态、逼真且多视图一致的 4D 化身。该方法通过将姿态相关的表面动力学嵌入到动态纹理贴图中,克服了现有方法的局限性,使其能够与预先训练的视频扩散模型兼容。该系统将这些纹理解码为 3D 高斯以进行渲染,并收集了一个新的大规模数据集来支持其训练和评估。

  9. RESEARCH · CL_206677 ·

    AnyTalk 使用视频扩散模型进行 3D 语音动画

    研究人员开发了 AnyTalk,一种为任意角色创建 3D 语音动画的新方法,无需现有的动画数据。该方法通过一种称为特定角色微调(CsF)的过程来调整预训练的视频扩散模型。然后,该方法从合成的说话头视频中估计混合形状参数,以生成唇形同步动画,从而大大减少了手动工作量。还开发了一个名为 AnyTalk_RT 的实时版本,以实现更快的性能。

  10. RESEARCH · CL_194118 ·

    新的视频世界模型以更少的参数外推物理定律

    研究人员开发了潜在动力学推理(LDR),一种新颖的视频世界模型方法,将运动学动力学集成到结构化潜在空间中。与现有的视频扩散模型相比,该方法允许模型以显著更少的参数和更快的推理时间,在外推物理定律方面超越其训练数据。LDR在物理基准测试中得到了验证,证明了在分布内和分布外场景之间的误差差距得到了实质性减少,并且即使在训练数据发生严重偏移的情况下也显示出泛化能力。

  11. RESEARCH · CL_191385 ·

    新的AI方法解决了视频反射的移除和生成问题 · 追踪4个来源

    研究人员开发了处理视频反射的新颖方法,解决了移除不需要的反射和生成逼真镜面反射的挑战。一种名为S2R-Synthesis的方法使用基于物理的模拟来创建成对的反射和无反射视频,从而能够训练S2R-Removal,这是一个基于扩散的视频去反射模型,实现了最先进的性能和快速推理。同时,MirrorWorld框架通过语义关系蒸馏和几何变换对齐来模拟场景到镜面的关系,解决了镜面反射的生成问题,提高了反射重建质量,并为该任务树立了新的基准。

  12. TOOL · CL_180900 ·

    新的 DAR 方法使视频模型能够渲染 4D 场景

    研究人员开发了 DAR,这是一种新颖的方法,使预训练的视频扩散模型能够充当 4D 渲染器。该方法使用动画网格、相机轨迹和参考图像来约束这些模型,从而实现考虑相机运动和内部对象动画的场景生成。DAR 投影一个神经 4D G-缓冲区,其中包含跟踪、世界位置和法线信息,然后通过加宽的控制适配器将其集成到模型中。在 DAR-4D 基准测试上的评估表明,与 Wan2.2-Depth 等现有方法相比,PSNR、SSIM 和 LPIPS 有显著提高。

  13. TOOL · CL_165208 ·

    AgentHOI框架利用多智能体推理生成人体-物体交互视频

    研究人员推出AgentHOI,一个用于生成人体-物体交互视频的新颖框架。该系统采用多智能体推理来弥合文本描述与动作的物理执行之间的差距,超越了依赖显式运动控制的现有方法。AgentHOI通过隐式对齐策略增强了文本到运动的理解,能够在推理过程中无需显式运动输入即可合成逼真的交互。该框架在交互自然性、物体外观保持性和遵循复杂文本指令方面取得了显著改进。

  14. RESEARCH · CL_147864 ·

    MagicPrompt 为视频生成提供超轻量级调优

    研究人员推出 MagicPrompt,一个旨在提高视频生成模型效率的新框架。该方法采用注意力嵌入式提示调优(Attention-Embedded Prompt Tuning),使用的参数比传统微调少得多,同时保留了模型的预训练知识。此外,MagicPrompt 还结合了双空间奖励反馈优化(Dual-Space Reward Feedback Optimization)来稳定条件引导任务的训练。实验表明,MagicPrompt 以不到 …

  15. TOOL · CL_129030 ·

    InverseCrafter框架可在无需VDM微调的情况下实现高效视频重捕获

    研究人员推出了一种新颖的框架InverseCrafter,用于在无需对预训练视频扩散模型(VDM)进行大量微调的情况下生成视频的新视角。该方法将视频重捕获视为潜在空间中的逆问题,利用轻量级的潜在掩码编码器来避免计算成本高昂的训练和灾难性遗忘问题。InverseCrafter通过以最小的额外推理成本保留原始VDM的生成能力,实现了高效、高保真的视频修复和编辑。

  16. RESEARCH · CL_128430 ·

    新研究解决扩散模型效率和应用问题 · 追踪8个来源

    近期研究探索了扩散模型的进展,重点在于提高其效率和在各个领域的适用性。FlashDiff 引入了自适应区域执行和调度,以降低图像、视频和音频生成的服务延迟并提高吞吐量。视频扩散模型中存在“序列性差距”挑战,即性能会随着因果链的延长而下降,这表明需要改进序列计算。其他工作提出了使用检索增强扩散 Transformer 进行异步时间序列预测的 ReDiTT,并探索了无需重新训练即可提高扩散模型多样性的方差校正时间偏移。此外,Singula…

  17. RESEARCH · CL_115329 ·

    新研究探索使用扩散模型进行先进的视频生成和处理

    研究人员正在探索使用扩散模型来改进视频生成和处理的先进技术。一种方法是将状态空间模型(SSM)与视频扩散模型集成,以提高效率并处理更长的序列,在内存使用和性能方面优于基于注意力的方法。其他研究则侧重于通过使用扩散 Transformer 和自适应来提高视频重新照明中的时间一致性,并通过利用预训练的视频扩散模型从视频中重建 4D 手部运动。此外,还在开发用于高效视频恢复和鲁棒点跟踪的方法,方法是调整扩散模型的特征和训练策略。

  18. RESEARCH · CL_111312 ·

    NaviCache 通过新颖的自校准技术加速视频生成

    研究人员推出了一种名为 NaviCache 的新颖方法,旨在通过解决视频扩散模型 (VDM) 的计算成本来加速视频生成。与依赖离线校准或瞬时近似的先前方法不同,NaviCache 采用了一种测试时间自校准技术。它将特征演化建模为惯性导航系统 (INS) 问题,自适应地跟踪特征变化及其潜在漂移,从而实现有误差界限的计算跳过。在 HunyuanVideo 和 Open-Sora 等数据集上的实验表明,NaviCache 提高了计算跳过的准…

  19. TOOL · CL_96130 ·

    新的REINS方法在无需重新训练的情况下引导视频扩散模型实现安全

    研究人员开发了一种名为REINS(REpresentation-space INference-time Safety steering,表示空间推理时安全引导)的新型无需训练的方法,用于对齐视频扩散模型并防止生成不安全内容。该技术通过在推理时引导模型的内部表示来实现,而无需昂贵的安全微调。REINS识别模型隐藏状态中区分安全与不安全内容的特定方向,并通过将此方向添加到中间层,以最小的计算开销将有害生成重定向到安全替代方案。该方法已在…

  20. RESEARCH · CL_104026 ·

    新研究提升3D高斯溅射的效率和编辑能力

    研究人员正在推进3D高斯溅射(3DGS)技术,以提高效率、准确性和编辑能力。新方法侧重于结合不确定性量化以实现更好的主动视图选择和场景重建,开发可证明的核集构造用于压缩,并增强具有一致性增强框架的以自我为中心的场景生成。此外,进展包括大规模场景的结构感知调度、动态场景的运动方差引导时间注意力、鲁棒的部件级编辑以及用于纹理操纵的内在分解。