两篇新研究论文提出了通过操纵初始噪声输入来提高基于扩散的视频生成可控性的新方法。第一篇论文 WINRO 专注于文本到运动生成,通过检索和精炼承载潜在语义结构的“获胜噪声票据”,在不重新训练基础模型的情况下增强文本-运动对齐。第二篇论文 UniCaMo 通过构建共享的 3D 接地运动一致噪声空间来解决可控视频生成问题,通过噪声变形和球形采样实现对对象和相机运动的同时控制,并通过轻量级 LoRA 微调实现最先进的结果。 AI
影响 这些方法通过操纵初始噪声提供了对视频生成能力的改进控制,有可能实现更精确和语义一致的视频合成。
排序理由 两篇在 arXiv 上发表的学术论文,提出了用于基于扩散的视频生成的新颖方法。
AI 生成摘要 · Google Gemini · 来自 3 个来源。 我们如何撰写摘要 →