研究人员开发了 LiveAnimate,一个能够实时生成稳定、长篇幅人体动画的新颖系统。该系统利用一个拥有140亿参数的视频扩散 Transformer,并通过 Reference-Anchored Teacher-Forcing Adaptation 和 Block-wise Self-Forcing Distillation 等专门的训练技术进行增强,以实现三步采样预算。为了在不增加计算负载的情况下保持长时间的视觉一致性,LiveAnimate 采用了 Pose-Retrieval Sink Attention,这是一种有界的 KV 缓存机制,可根据姿势相似性选择性地回忆外观上下文。这使得在双 NVIDIA H100 GPU 上能够以大约 19.63 FPS 的速度进行流式推理,在交互式动画的质量和效率方面均显著优于先前的方法。 AI
影响 能够实现实时交互式应用,如具有高质量、长篇幅人体动画的直播和虚拟化身。
排序理由 该集群描述了一篇详细介绍用于动画生成的新颖系统的研究论文。
在 Hugging Face Daily Papers 阅读 →
- Block-wise Self-Forcing Distillation
- Diffusion Transformer
- LiveAnimate
- NVIDIA H100
- Pose-Retrieval Sink Attention
- Reference-Anchored Teacher-Forcing Adaptation
- Static Sink
- Ulysses
- KV cache
AI 生成摘要 · Google Gemini · 来自 2 个来源。 我们如何撰写摘要 →