Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion
PulseAugur coverage of Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion — every cluster mentioning Diffusion Forcing: Next-token Prediction Meets Full-Sequence Diffusion across labs, papers, and developer communities, ranked by signal.
3 天有情绪数据
-
Vorch-Streamer 实现实时、长格式头像音视频生成
研究人员开发了 Vorch-Streamer,这是一个专为从文本进行实时、长格式头像音视频生成而设计的新框架。该系统通过采用混合教师强制和扩散强制的训练后方法,解决了连续合成中的错误累积和视觉漂移等挑战。Vorch-Streamer 还利用外部语言模型预测语音进展,确保音频和视觉内容之间的对齐,并实现了 27.12 FPS 的生成速率,超过了实时播放要求。
-
新的交互式视频世界模型框架出现
研究人员推出了两个新的视频世界模型框架,这对于具身AI和交互式模拟至关重要。第一个框架HelloWorld通过允许角色响应诸如转弯或挥手之类的提示,实现了用户与视频环境中的角色之间的社交互动。它利用了自蒸馏管道和新颖的推理模块来实现响应的时间局部化。第二个框架MiniWorld旨在通过提供一个轻量级、可复现的系统,该系统可以在适度的计算资源上从头开始训练,从而实现这些模型的训练民主化。MiniWorld采用了块因果视频扩散Transf…
-
视频扩散模型因表示坍塌而遭受复合误差
研究人员发现了一个关键机制,解释了视频扩散模型中复合误差的产生原因,该误差会降低长生成序列中的帧质量。他们发现这种误差累积与模型内部表示的维度坍塌密切相关,导致这些表示的有效秩急剧下降。与典型的扩展范例相反,仅仅增加训练数据并不能提高模型对此类误差漂移的抵抗力。为了解决这个问题,该团队开发了一种新颖的视频表示正则化技术,该技术可以稳定潜在表示并减少迭代误差累积,从而在VBench基准测试中显著提高视频质量指标。
-
新的ForcingDAS框架统一数据同化以改进预测
研究人员开发了ForcingDAS,这是一个用于数据同化的新框架,它统一了滤波和预测方法。该方法使用扩散强制来学习联合轨迹先验,这有助于捕捉长时序依赖关系并减少误差累积,这与传统的逐帧过渡模型不同。ForcingDAS通过使用单个训练模型来完成整个推理任务,在包括天气预报和大气状态估计在内的各种应用中,其性能与专用基线相比具有竞争力或更优。