PulseAugur
实时 10:17:30
English(EN) Beyond Pixels: From Video Priors to 4D Worlds

Latent-to-4D 方法可从视频潜在表示生成可复用的三维场景

研究人员开发了 Latent-to-4D,一种从文本或图像生成动态三维场景的新颖方法。该方法通过将视频扩散潜在表示与四维解码器直接对齐,绕过了重建 RGB 视频的需要。在相同的变分自编码器家族内,单个训练好的检查点可以跨不同的视频扩散 Transformer 重用,在 Text4D-200I4D-200 等基准测试中展示了比现有方法更好的性能和人类偏好。 AI

影响 能够更高效、可复用地生成动态三维场景,可能对虚拟现实和内容创作等领域产生影响。

排序理由 该集群描述了一篇详细介绍一种新颖的四维生成方法的研究论文。

在 Hugging Face Daily Papers 阅读 →

AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →

Latent-to-4D 方法可从视频潜在表示生成可复用的三维场景

报道来源 [3]

  1. Hugging Face Daily Papers TIER_1 English(EN) ·

    超越像素:从视频先验到四维世界

    4D generation synthesizes dynamic 3D scenes from conditions such as text or images. Existing methods either reconstruct generated RGB videos with a separate 4D model or adapt a particular video generator to predict geometry directly. The former suffers from distribution mismatch …

  2. Hugging Face Daily Papers TIER_1 English(EN) ·

    超越像素:从视频先验到四维世界

    Latent-to-4D enables reusable direct 4D generation from video diffusion latents via alignment with a pretrained decoder and spatiotemporal attention, transferring across generators without retraining.

  3. arXiv cs.CV TIER_1 English(EN) · Zihao Liu, Xiaolong Shen, Zhenglin Zhou, Ruijie Quan, Yi Yang ·

    超越像素:从视频先验到四维世界

    arXiv:2608.10744v1 Announce Type: new Abstract: 4D generation synthesizes dynamic 3D scenes from conditions such as text or images. Existing methods either reconstruct generated RGB videos with a separate 4D model or adapt a particular video generator to predict geometry directly…