研究人员推出LynnReal-Omni,一个专为代理视觉工作流设计的新型多模态视频生成框架。该系统利用一个32B的共享多模态扩散 transformer 来统一各种视频生成任务,包括文本到视频、图像条件生成和长视频生成,接受3D渲染和游戏录制等多样化的视觉输入。还开发了一个更快的版本LynnReal-Omni-Flash,用于实时渲染,在NVIDIA H100上不到一秒即可生成22帧540p视频。该框架得到了全面的数据管道和新的评估设计MSAVP的支持,以评估多维度的视频生成质量。 AI
影响 为AI代理实现更可控、更高保真度的视频生成,可能加速视觉内容的创作。
排序理由 详细介绍新型多模态视频生成框架的研究论文。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →