Video Diffusion Model
PulseAugur coverage of Video Diffusion Model — every cluster mentioning Video Diffusion Model across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
新的SNM-VFI框架通过运动引导增强视频帧插值
研究人员推出了一种用于生成视频中间帧的新型框架SNM-VFI。该方法利用预训练的光流和视频扩散模型,通过运动感知信息引导生成过程,这与从随机噪声开始的传统方法不同。SNM-VFI在DAVIS、Sintel和KITTI等基准测试中表现出色,显示出改进的感知质量和时间连贯性。
-
镜像学习框架利用第三人称数据增强模仿学习
研究人员引入了一个名为“镜像学习”的新颖框架,通过利用第三人称观察数据来增强模仿学习。该方法结合了一个由微调视频扩散模型驱动的学习视角转换和一个逆动力学模型来推断动作轨迹。该方法生成“镜像数据”,这是通过观察演示者行为合成的伪第一人称专家数据,即使没有直接的第一人称数据也能进行有效的策略训练。用这些镜像数据增强传统的行为克隆已被证明可以提高下游策略的性能,这表明生成式世界模型可以为数据收集提供一种可扩展且安全的选择,替代大量的远程操作。
-
新方法从静态图像重建可动对象
研究人员开发了一种从单一静态观测中重建可动对象的新方法,克服了先前需要显式运动数据的技术的局限性。该框架利用显式网格作为中间表示,整合了视觉语言和分割模型的输出来创建空间一致的部件结构。为了在没有观测到运动的情况下推断关节参数,该系统采用视频扩散模型,根据几何一致性生成和验证关节假设,取得了与现有方法相比具有竞争力的性能。
-
新的ViDS系统使用3D面部追踪进行逼真的肖像动画
研究人员开发了ViDS,一种新颖的视频扩散着色器,它利用3D面部追踪来创建逼真且保留身份的肖像动画。该系统从参考图像中重建3D可变形模型(3DMM)网格,并使用驱动视频中的表情和姿势数据对其进行动画处理。ViDS采用视频扩散模型作为神经着色器,利用3DMM法线贴图中的密集几何线索生成逼真的动画,从而保持原始外观和身份。与以前的方法相比,该方法在表情和姿势控制方面有所改进,并且自回归扩散采样过程增强了生成片段之间的一致性。
-
新的AI方法增强三维渲染、重建和动画 · 已追踪4个来源
研究人员正在开发新的方法,通过整合扩散模型和先进的优化技术来增强三维渲染和重建。一种名为特征引导扩散演化(FIDE)的方法,使用Vision Transformers提取的视觉特征来指导扩散模型和CMA演化策略进行不可微逆渲染,其性能优于传统的基于梯度的方法。另一项开发是FutureSurf,它提出了一个用于动态表面重建的基准和数据集,并指出当前方法在预测观察时间窗口之外的未来几何形状方面存在困难。此外,Texture++提出了一种用…
-
ProxyPose 使用视频到视频翻译进行 6-DoF 位姿跟踪
研究人员开发了 ProxyPose,一种从单目视频跟踪物体和表面六自由度 (6-DoF) 位姿的新颖方法。该方法将问题重新定义为视频到视频翻译任务,利用微调的视频扩散模型生成合成代理视频。通过分析此代理视频中已知物体的运动,ProxyPose 可以准确恢复原始表面的 6-DoF 轨迹。该技术无需 3D 模型或深度图等额外输入,展示了最先进的性能,并可扩展到面部跟踪和相机位姿估计等应用。
-
New AI model learns joint distribution of videos and camera trajectories
研究人员开发了一种名为 Rays as Pixels 的新型视频扩散模型,该模型学习视频和相机轨迹的联合分布。该模型是第一个在单一框架内从新颖视角预测相机姿态并生成视频的模型。通过将相机表示为与视频帧相同的潜在空间中的射线像素(raxels),该模型可以执行诸如预测相机轨迹、根据定义路径的输入图像生成视频以及联合合成视频和轨迹等任务。
-
用于视频生成的扩散模型
研究人员正在探索用于视频生成的先进扩散模型,以解决时间一致性和数据稀缺性等挑战。新方法侧重于改进参数化,例如 v-prediction 技术,并结合条件采样来完成扩展视频长度或填充缺失帧等任务。同时,通过训练后框架、混合注意力机制和语义视觉适应性,也在努力提高效率和可控性,目标是实现实时生成和更高质量的输出。