VBench
PulseAugur coverage of VBench — every cluster mentioning VBench across labs, papers, and developer communities, ranked by signal.
7 天有情绪数据
-
SQuad框架通过子二次注意力大幅降低视频Transformer的计算成本
研究人员开发了SQuad,一个子二次注意力蒸馏框架,旨在提高视频扩散Transformer(DiTs)的效率。该新方法降低了自注意力机制的计算成本,该机制通常随token数量呈二次方增长。SQuad实现了O(n√n)的复杂度,显著降低了FLOPs和延迟,同时保持了可比的视频生成质量。
-
SparSTAR 方法通过稀疏注意力加速视频合成
研究人员开发了 SparSTAR,一种用于视频合成的无训练稀疏注意力新方法。该技术旨在优化 InfinityStar 模型,该模型使用图像和剪辑金字塔序列生成视频。SparSTAR 通过智能选择和处理关键块来解决后期注意力计算成本问题,从而在端到端生成中实现 1.6 倍的速度提升,同时在文本到视频和图像到视频任务中保持高保真度。
-
SparSTAR 通过稀疏注意力提高了视频合成效率
研究人员开发了 SparSTAR,一种用于稀疏注意力的创新方法,旨在提高 InfinityStar 等自回归视频合成模型的效率。SparSTAR 通过选择性地计算注意力块来解决视频生成中不同尺度和跨剪辑上下文相关的计算成本问题。该方法在保持视频合成任务高保真度的同时,提供了约 1.6 倍的显著加速。
-
新的RACER控制器提高了扩散模型的速度和可靠性 · 跟踪2个来源
研究人员开发了RACER,一种新的闭环控制器,旨在提高扩散模型的效率和可靠性。与盲目信任预测的先前方法不同,RACER分析预测之间的一致性,以确定何时以及在多大程度上信任它们。这种方法允许在不牺牲质量的情况下更积极地加速扩散采样,从而在SD3.5-Large、FLUX.1-dev、Wan2.1-14B和HunyuanVideo等各种模型中实现更快的生成速度。
-
视频扩散模型因表示坍塌而遭受复合误差
研究人员发现了一个关键机制,解释了视频扩散模型中复合误差的产生原因,该误差会降低长生成序列中的帧质量。他们发现这种误差累积与模型内部表示的维度坍塌密切相关,导致这些表示的有效秩急剧下降。与典型的扩展范例相反,仅仅增加训练数据并不能提高模型对此类误差漂移的抵抗力。为了解决这个问题,该团队开发了一种新颖的视频表示正则化技术,该技术可以稳定潜在表示并减少迭代误差累积,从而在VBench基准测试中显著提高视频质量指标。
-
DistillAlign 通过分布对齐改进视频蒸馏
研究人员推出了一种新颖的自回归视频蒸馏方法 DistillAlign,解决了现有分阶段流水线的局限性。该方法强调学生模型和教师模型之间的分布对齐,提出了一种结合分布匹配蒸馏 (DMD) 和一致性蒸馏的联合蒸馏技术。该方法旨在提高生成质量、覆盖率和多样性,其表现明显优于使用更大教师模型的基线。
-
MXAttention 框架优化 MXFP4 注意力以用于视频生成
研究人员开发了 MXAttention,这是一个新颖的、无数据的训练后量化框架,旨在优化基于扩散的视频生成模型中的 MXFP4 注意力。该框架解决了数值问题,如裁剪-下溢权衡和归一化错误,这些问题通常会降低生成质量。MXAttention 结合了通用最优缩放 (UOS) 以实现独立于分布的缩放,以及预归一化量化 (PNQ) 以保持归一化精度。实验表明,MXAttention 显著缩小了 MXFP4 和 FP16 格式之间的质量差距,以…
-
CachedSearch 通过新颖的缓存加速视频扩散模型搜索
研究人员开发了 CachedSearch,一种新颖的、无需训练的方法,用于加速视频扩散模型的测试时搜索。该技术通过积极缓存中间结果,显著降低了生成高质量视频输出的计算成本,使每次运行速度提高 2-3 倍,而质量没有明显下降。CachedSearch 通过缓存探索候选结果,然后仅以完整计算重新生成最佳结果,从而在降低成本的同时捕获了完整搜索超过 94% 的收益。该方法已被证明在各种模型尺寸和架构(包括 Wan、LTX、CogVideoX…
-
新框架通过自适应资源分配增强长视频生成
研究人员开发了一个名为“惊喜强制”(Surprise Forcing)的新框架,以改进扩散模型生成长视频的性能。该方法解决了当前流式自回归扩散模型在有界上下文和固定去噪时间表方面的局限性。惊喜强制通过使用“惊喜门控记忆库”(Surprise-Gated Memory Bank)来总结被驱逐的帧,以及一个基于块难度的去噪步骤调整的“惊喜感知去噪”(Surprise-Aware Denoising)过程,来优化资源分配。在VBench等基…
-
新的PSDPO方法在文本到视频生成中平衡物理可行性和语义一致性
研究人员推出了一种新方法——物理和语义直接偏好优化(PSDPO),以解决文本到视频生成中物理可行性与语义一致性之间的固有冲突。PSDPO通过物理和语义信号之间的一致性来调节偏好对,从而有效地限制语义漂移。该方法在标准的直接偏好优化框架内运行,无需辅助模型或额外的损失项。实验表明,PSDPO显著提高了物理可行性,同时保持了强大的语义一致性,比现有方法提供了更可靠的平衡。
-
新的 TANGO 方法增强了自回归视频生成的真实感
研究人员开发了一种名为 TANGO(通过噪声引导优化避免终点)的新方法,以改进自回归视频生成模型。该技术通过使用扩散模型本身来指导生成过程,解决了误差累积和模型漂移的问题。TANGO 预测噪声分布,以确保生成的帧保持在真实视频的学习流形内,从而在真实感方面取得显著改进,并降低了 Fréchet Video Distance。
-
Cycle-World 框架解决了长视频生成中的误差累积问题
研究人员推出了一种名为 Cycle-World 的新框架,旨在提高长时视频生成的稳定性和时间一致性。该方法通过在训练和推理过程中强制执行时间可逆性来解决自回归扩散模型中的误差累积问题。通过集成反向预测模型,Cycle-World 旨在限制生成漂移,并使用该模型作为运行时校正器来迭代地优化生成序列,从而显著减少视觉退化和结构崩溃。在 VBench 基准测试上的实验表明,Cycle-World 在生成高质量、时间一致的 60 秒视频方面取…
-
MobileWan:为移动部署优化的 5B 视频扩散模型
研究人员开发了 MobileWan,一个拥有 50 亿参数的视频扩散模型,可以在移动设备上运行。这是通过一种循环重构和结构化压缩技术实现的,该技术允许大型服务器级模型在内存受限的硬件上高效运行。MobileWan 使用一种循环蒸馏框架和因果线性注意力,以分块自回归的方式处理视频生成,保持时间连贯性。该模型还集成了注意力头剪枝和内存优化解码,使其能够在约 20 秒内生成 480x832 分辨率的 5 秒视频,以 83.79 的 VBen…
-
新框架对视频生成模型中的运动进行归因
研究人员开发了 Motive,一个新颖的基于梯度的框架,用于对视频生成模型中的运动进行归因。该方法将时间动态与静态外观分离开来,能够高效且可扩展地计算运动特定的影响。将 Motive 应用于文本到视频模型,可以识别出增强或削弱运动的有影响力的片段,从而指导数据策展以提高时间一致性和物理合理性。该框架通过提高运动平滑度和动态程度,在 VBench 上取得了 74.1% 的人类偏好胜率。
-
开源AI视频模型:性能声明与现实的差距
开源AI视频模型领域竞争激烈且常常具有误导性,各种模型在VBench等基准测试中声称性能优越。诸如Wan-2.2、Open-Sora 2.0和HunyuanVideo等模型被频繁提及,但其报告的指标可能无法准确反映实际能力或显存需求。虽然自托管有潜在优势,但对于某些用例,Runway ML等商业解决方案可能仍然是更好的选择。
-
新的自回归模型应对视频生成挑战 · 跟踪 8 个来源
研究人员正在开发新方法来改进自回归视频生成,解决时间不一致和交互失败等问题。事件驱动视频生成 (EVD) 引入了显式的事件信号来指导采样器,从而提高动态和空间准确性。GEAR(引导式端到端自回归)联合训练分词器和生成器,以实现更快的收敛和更好的特征连贯性。Drift-AR 通过利用预测熵来加速自回归和扩散阶段,从而实现单步解码。TempAct 使用规划器-执行器强化学习框架来增强时间合理性和指令遵循能力,而“Directing the…
-
PhysRAG 管道通过物理知识增强 AI 视频生成 · 已追踪 2 个来源
研究人员推出 PhysRAG,这是一个旨在提高 AI 生成视频物理准确性的新管道。该方法利用检索增强生成 (RAG) 来克服训练数据的局限性,将大型数据集筛选为 7,000 个高质量视频。PhysRAG 构建了一个物理视频数据库,并将这些知识整合到视频扩散模型中,在 PhyGenBench 和 VBench 等基准测试中,在视觉质量和遵守物理定律方面均取得了最先进的成果。
-
LearniBridge 通过可学习特征缓存加速扩散模型 · 已追踪 2 个来源
研究人员开发了 LearniBridge,一种通过优化特征缓存来加速 Diffusion Transformers (DiTs) 等扩散模型的新颖方法。该技术通过使用轻量级 LoRA 更新来校准多个时间步之间的中间表示,从而解决了现有方法中的误差累积问题。LearniBridge 仅需少量训练数据,并在各种图像和视频生成任务上实现了显著的加速,最高可达 5.87 倍,同时在基准测试中保持或提高了性能。
-
新研究探索用于大型语言模型的混合和稀疏注意力机制
研究人员正在探索优化大型语言模型中注意力机制的新方法,特别是用于处理长上下文。例如,HydraHead架构沿头轴混合了全注意力(FA)和线性注意力(LA),识别关键的FA头并协调分布差异。另外,StreamKL提供了一种快速且内存高效的方法来计算注意力蒸馏的Kullback-Leibler散度,减少了HBM占用空间,并支持在单个GPU上进行长上下文蒸馏。其他研究包括基于域分解的分层注意力和距离自适应表示,后者为远距离标记分配较低的维度…
-
新的SARA方法提升视频扩散模型对齐度
研究人员开发了SARA,一种通过将监督集中在视频的语义相关部分来改进视频扩散模型的新方法。该方法利用文本条件显著性来确定视频生成过程中哪些令牌对对于与提示对齐最重要。在评估中,SARA与现有方法相比,在文本对齐和运动质量方面均有所提高。