PulseAugur
中
实时 05:51:44
实体 VBench

VBench

PulseAugur coverage of VBench — every cluster mentioning VBench across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
37
90 天内 37
发布 · 30天
0
90 天内 0
论文 · 30天
35
90 天内 35
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 37 条
  1. RESEARCH · CL_275205 ·

    新的DMAD方法通过对抗性蒸馏加速视觉生成

    研究人员推出了一种新颖的、用于更快视觉生成的方法DMAD,该方法将分布匹配重新构建为分类问题。该方法无需辅助扩散模型即可训练学生模型,直接通过对抗性蒸馏学习对数密度比。DMAD在ImageNet-64x64和COCO-10K等基准测试中取得了最先进的成果,并在联合音频视频生成任务中表现出强大的性能。

  2. TOOL · CL_286424 ·

    DMAD 通过对抗蒸馏加速视觉生成

    研究人员开发了 DMAD,一种新颖的对抗蒸馏方法,可显著加快视觉生成过程。与需要辅助扩散模型的先前技术不同,DMAD 使用判别器直接学习对数密度比,从而实现更快的训练和推理。该方法在图像、视频和音视频生成方面取得了最先进的成果,在 ImageNet-64x64 上单步实现了 1.04 FID 等令人印象深刻的性能指标。

  3. TOOL · CL_269455 ·

    SkillPE框架通过电影化技能增强文本到视频生成

    研究人员开发了SkillPE,一个旨在通过从专家提示中演进电影化技能来增强文本到视频生成的框架。该系统以详细的格式表示电影制作元素,如镜头逻辑、构图和声音设计,并使用电影参考来优化技能应用。SkillPE根据提示保真度、电影质量、叙事吸引力和创造力来评估候选技能,并在StoryEval和VBench等基准测试中展示了改进。

  4. TOOL · CL_249698 ·

    新的EFQ-Softmax方法优化Transformer的低比特量化

    研究人员开发了EFQ-Softmax,一种用于Transformer模型低比特量化的新颖方法,它绕过了Softmax的传统指数计算。该方法直接将移位的注意力分数映射到E2M1操作数,在不牺牲模型质量的情况下优化效率。在Qwen3-8B和Qwen3-VL-8B-Instruct等模型上的评估显示性能指标有所提高,并且在A5向量单元上的内核级测试证明延迟显著降低。

  5. RESEARCH · CL_235689 ·

    DSAQuant框架改进视频扩散模型量化

    研究人员开发了DSAQuant,一个专为视频扩散模型(VDMs)设计的量化感知训练(QAT)新框架。现有的QAT方法在VDMs上表现不佳,尽管能保留语义,但常常会损害视觉细节和清晰度。DSAQuant通过将量化与视频去噪的阶段性相结合来解决这个问题,优化早期步骤以获取结构,优化后期步骤以进行细节重建。实验表明,DSAQuant在激进量化下显著优于当前基线,将VBench分数提高了多达6.60,同时保持了文本-视频对齐。

  6. RESEARCH · CL_235143 ·

    新的Principia基准揭示了视频AI模型中重大的物理推理差距

    一个名为Principia的新基准已被开发出来,用于评估视频生成模型在物理推理方面的能力,特别关注牛顿物理学。该基准评估场景中物体之间的关系一致性,这与相机校准和帧率无关,解决了先前评估方法的局限性。研究发现,当前最先进的视频生成器在物理推理方面存在显著差距,尽管在VBench等其他基准上表现良好,但在Principia上的得分均未超过0.42。视觉语言模型也难以检测物理违规,这表明需要改进AI对物理定律的理解。

  7. TOOL · CL_229542 ·

    新的NoisEasier框架提升文本到视频生成的一致性

    研究人员开发了NoisEasier,一个新颖的测试时优化框架,旨在增强文本到视频生成模型。该方法在推理过程中优化噪声轨迹,在不改变基础模型的情况下提高了组合一致性,如属性绑定和对象交互。在VBench和T2V-CompBench等基准测试上的实验显示出显著的提升,尤其是在属性绑定和数字等具有挑战性的领域,证明了其作为现有微调技术的补充增强的有效性。

  8. RESEARCH · CL_218240 ·

    FIRM-Video 框架通过清单验证增强文本到视频奖励建模 · 跟踪 2 个来源

    研究人员推出 FIRM-Video,一个用于在文本到视频生成中创建可靠奖励模型的新框架。该方法采用“评分前检查”方法,将评估分解为针对指令遵循、世界连贯性和感知质量的特定、可验证的标准。该框架已促成了 FIRM-Video-90K 数据集的构建,该数据集包含近 90,000 个实例,以及带有用户标注的 FIRM-Video-Bench 基准测试。基于 Qwen3-VL 的模型 FIRM-Video-8B 在该基准测试中表现出卓越的性能…

  9. RESEARCH · CL_206644 ·

    SQuad框架通过子二次注意力大幅降低视频Transformer的计算成本

    研究人员开发了SQuad,一个子二次注意力蒸馏框架,旨在提高视频扩散Transformer(DiTs)的效率。该新方法降低了自注意力机制的计算成本,该机制通常随token数量呈二次方增长。SQuad实现了O(n√n)的复杂度,显著降低了FLOPs和延迟,同时保持了可比的视频生成质量。

  10. TOOL · CL_196205 ·

    SparSTAR 方法通过稀疏注意力加速视频合成

    研究人员开发了 SparSTAR,一种用于视频合成的无训练稀疏注意力新方法。该技术旨在优化 InfinityStar 模型,该模型使用图像和剪辑金字塔序列生成视频。SparSTAR 通过智能选择和处理关键块来解决后期注意力计算成本问题,从而在端到端生成中实现 1.6 倍的速度提升,同时在文本到视频和图像到视频任务中保持高保真度。

  11. TOOL · CL_202787 ·

    SparSTAR 通过稀疏注意力提高了视频合成效率

    研究人员开发了 SparSTAR,一种用于稀疏注意力的创新方法,旨在提高 InfinityStar 等自回归视频合成模型的效率。SparSTAR 通过选择性地计算注意力块来解决视频生成中不同尺度和跨剪辑上下文相关的计算成本问题。该方法在保持视频合成任务高保真度的同时,提供了约 1.6 倍的显著加速。

  12. RESEARCH · CL_180670 ·

    新的RACER控制器提高了扩散模型的速度和可靠性 · 跟踪2个来源

    研究人员开发了RACER,一种新的闭环控制器,旨在提高扩散模型的效率和可靠性。与盲目信任预测的先前方法不同,RACER分析预测之间的一致性,以确定何时以及在多大程度上信任它们。这种方法允许在不牺牲质量的情况下更积极地加速扩散采样,从而在SD3.5-Large、FLUX.1-dev、Wan2.1-14B和HunyuanVideo等各种模型中实现更快的生成速度。

  13. TOOL · CL_171957 ·

    视频扩散模型因表示坍塌而遭受复合误差

    研究人员发现了一个关键机制,解释了视频扩散模型中复合误差的产生原因,该误差会降低长生成序列中的帧质量。他们发现这种误差累积与模型内部表示的维度坍塌密切相关,导致这些表示的有效秩急剧下降。与典型的扩展范例相反,仅仅增加训练数据并不能提高模型对此类误差漂移的抵抗力。为了解决这个问题,该团队开发了一种新颖的视频表示正则化技术,该技术可以稳定潜在表示并减少迭代误差累积,从而在VBench基准测试中显著提高视频质量指标。

  14. RESEARCH · CL_172027 ·

    DistillAlign 通过分布对齐改进视频蒸馏

    研究人员推出了一种新颖的自回归视频蒸馏方法 DistillAlign,解决了现有分阶段流水线的局限性。该方法强调学生模型和教师模型之间的分布对齐,提出了一种结合分布匹配蒸馏 (DMD) 和一致性蒸馏的联合蒸馏技术。该方法旨在提高生成质量、覆盖率和多样性,其表现明显优于使用更大教师模型的基线。

  15. TOOL · CL_167429 ·

    MXAttention 框架优化 MXFP4 注意力以用于视频生成

    研究人员开发了 MXAttention,这是一个新颖的、无数据的训练后量化框架,旨在优化基于扩散的视频生成模型中的 MXFP4 注意力。该框架解决了数值问题,如裁剪-下溢权衡和归一化错误,这些问题通常会降低生成质量。MXAttention 结合了通用最优缩放 (UOS) 以实现独立于分布的缩放,以及预归一化量化 (PNQ) 以保持归一化精度。实验表明,MXAttention 显著缩小了 MXFP4 和 FP16 格式之间的质量差距,以…

  16. TOOL · CL_167229 ·

    CachedSearch 通过新颖的缓存加速视频扩散模型搜索

    研究人员开发了 CachedSearch,一种新颖的、无需训练的方法,用于加速视频扩散模型的测试时搜索。该技术通过积极缓存中间结果,显著降低了生成高质量视频输出的计算成本,使每次运行速度提高 2-3 倍,而质量没有明显下降。CachedSearch 通过缓存探索候选结果,然后仅以完整计算重新生成最佳结果,从而在降低成本的同时捕获了完整搜索超过 94% 的收益。该方法已被证明在各种模型尺寸和架构(包括 Wan、LTX、CogVideoX…

  17. TOOL · CL_156574 ·

    新框架通过自适应资源分配增强长视频生成

    研究人员开发了一个名为“惊喜强制”(Surprise Forcing)的新框架,以改进扩散模型生成长视频的性能。该方法解决了当前流式自回归扩散模型在有界上下文和固定去噪时间表方面的局限性。惊喜强制通过使用“惊喜门控记忆库”(Surprise-Gated Memory Bank)来总结被驱逐的帧,以及一个基于块难度的去噪步骤调整的“惊喜感知去噪”(Surprise-Aware Denoising)过程,来优化资源分配。在VBench等基…

  18. TOOL · CL_154613 ·

    新的PSDPO方法在文本到视频生成中平衡物理可行性和语义一致性

    研究人员推出了一种新方法——物理和语义直接偏好优化(PSDPO),以解决文本到视频生成中物理可行性与语义一致性之间的固有冲突。PSDPO通过物理和语义信号之间的一致性来调节偏好对,从而有效地限制语义漂移。该方法在标准的直接偏好优化框架内运行,无需辅助模型或额外的损失项。实验表明,PSDPO显著提高了物理可行性,同时保持了强大的语义一致性,比现有方法提供了更可靠的平衡。

  19. TOOL · CL_151889 ·

    新的 TANGO 方法增强了自回归视频生成的真实感

    研究人员开发了一种名为 TANGO(通过噪声引导优化避免终点)的新方法,以改进自回归视频生成模型。该技术通过使用扩散模型本身来指导生成过程,解决了误差累积和模型漂移的问题。TANGO 预测噪声分布,以确保生成的帧保持在真实视频的学习流形内,从而在真实感方面取得显著改进,并降低了 Fréchet Video Distance。

  20. RESEARCH · CL_141249 ·

    Cycle-World 框架解决了长视频生成中的误差累积问题

    研究人员推出了一种名为 Cycle-World 的新框架,旨在提高长时视频生成的稳定性和时间一致性。该方法通过在训练和推理过程中强制执行时间可逆性来解决自回归扩散模型中的误差累积问题。通过集成反向预测模型,Cycle-World 旨在限制生成漂移,并使用该模型作为运行时校正器来迭代地优化生成序列,从而显著减少视觉退化和结构崩溃。在 VBench 基准测试上的实验表明,Cycle-World 在生成高质量、时间一致的 60 秒视频方面取…