研究人员推出了 Video DeltaNet (VDN-H3),这是一种混合注意力模型,旨在加速视频生成同时保持高质量。该模型结合了高效的线性注意力和 softmax 分支,实现了快速推理速度,在 8 个 B200 GPU 上仅用 11 秒多就生成了 14.4 秒的视频片段。VDN-H3 被设计为即插即用,添加了一个单独的线性注意力分支和 LoRA 适配器,可以合并到现有骨干网络中而不改变其权重。该项目完全开源,权重、训练代码和优化的推理堆栈均已公开提供。 AI
影响 该模型的混合注意力架构可能带来更高效的视频生成工具,从而可能降低内容创作的门槛。
排序理由 该集群描述了一个具有技术细节和开源可用性的新模型发布。[lever_c_demoted from research: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →