PulseAugur
实时 08:58:52
实体 VBench 2.0

VBench 2.0

PulseAugur coverage of VBench 2.0 — every cluster mentioning VBench 2.0 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
0
90 天内 6
发布 · 30天
0
90 天内 0
论文 · 30天
0
90 天内 6
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 8 条
  1. RESEARCH · CL_199768 ·

    Alaya-EVOKE 推出交互式世界模型,用于开放式视频生成

    研究人员推出了 Alaya-EVOKE,一个专为开放式视频生成设计的交互式世界模型。该模型利用外部持久内存和一种新颖的长时域教师来实现低延迟的响应式生成。Evoke 通过外部化世界状态并重新设计教师以实现扩展监督,解决了维护历史和实现低延迟交互的挑战,在 WBench 等基准测试中取得了最先进的性能。

  2. TOOL · CL_185532 ·

    Flash-VAED 框架将视频生成速度提高 6 倍

    研究人员开发了 Flash-VAED,这是一个旨在加速用于视频生成的潜在扩散模型中的 VAE 解码器的框架。该方法采用通道剪枝和主导算子优化来降低推理成本,在保持高达 96.9% 的重建性能的同时,实现了约 6 倍的 VAE 解码速度提升。当集成到端到端生成管线中时,Flash-VAED 可将过程加速高达 36%,而对质量的影响极小,这在 VBench 2.0 等基准测试中得到了证明。

  3. TOOL · CL_183400 ·

    新的CAPE-T2V框架增强文本到视频生成的对齐

    研究人员推出CAPE-T2V,一个旨在通过解决训练字幕和推理时提示之间的不匹配来改进文本到视频生成的新框架。该系统首先微调一个提示增强器(PE),从源字幕生成各种目标提示。随后,它使用这些增强的字幕微调文本到视频扩散变换器(DiT),确保PE的输出与DiT的训练数据之间更好的对齐。这种方法在StoryEval和VBench 2.0等基准测试中提高了性能,并显示出“PE-字幕差距”的减小。

  4. TOOL · CL_167229 ·

    CachedSearch 通过新颖的缓存加速视频扩散模型搜索

    研究人员开发了 CachedSearch,一种新颖的、无需训练的方法,用于加速视频扩散模型的测试时搜索。该技术通过积极缓存中间结果,显著降低了生成高质量视频输出的计算成本,使每次运行速度提高 2-3 倍,而质量没有明显下降。CachedSearch 通过缓存探索候选结果,然后仅以完整计算重新生成最佳结果,从而在降低成本的同时捕获了完整搜索超过 94% 的收益。该方法已被证明在各种模型尺寸和架构(包括 Wan、LTX、CogVideoX…

  5. RESEARCH · CL_166867 ·

    新基准和模型提升了 AI 视频生成质量和控制力 · 跟踪 10 个来源

    近期研究探索了视频生成领域的进展,重点在于提高物理一致性、可控性和效率。论文介绍了新的基准,如用于电影级质量的 FilmBench 和用于统一运动与相机控制的 UniMoCa。ContextMaster 和 VideoCoCo 等模型分别旨在处理复杂的多镜头视频创作和物理上一致的动态。此外,正在开发 Token Radius Attention 和 MMPhysVideo 等技术,以提高视频生成模型的效率和物理合理性。

  6. TOOL · CL_156574 ·

    新框架通过自适应资源分配增强长视频生成

    研究人员开发了一个名为“惊喜强制”(Surprise Forcing)的新框架,以改进扩散模型生成长视频的性能。该方法解决了当前流式自回归扩散模型在有界上下文和固定去噪时间表方面的局限性。惊喜强制通过使用“惊喜门控记忆库”(Surprise-Gated Memory Bank)来总结被驱逐的帧,以及一个基于块难度的去噪步骤调整的“惊喜感知去噪”(Surprise-Aware Denoising)过程,来优化资源分配。在VBench等基…

  7. RESEARCH · CL_70561 ·

    新PILA框架通过物理信息对齐增强AI视频生成

    研究人员开发了一个名为PILA(Physics-Informed Latent Alignment)的新框架,以提高AI生成视频的物理合理性。PILA通过将潜在表示映射到物理属性库,并使用混合专家方法处理不同的动力学,将物理结构化引导注入现有的视频生成模型。该方法在多个基准测试中展示了最先进的结果,提高了生成内容的视觉质量和物理准确性。

  8. RESEARCH · CL_15510 ·

    Mamoda2.5 模型集成了多模态 AI 和高效的 DiT-MoE,用于顶级视频编辑

    研究人员推出了 Mamoda2.5,一个用于多模态理解和生成的统一 AR-Diffusion 框架。该模型利用了具有混合专家 (MoE) 设计的 Diffusion Transformer 主干,拥有 128 个专家和 Top-8 路由,形成了一个拥有 250 亿参数但仅激活 30 亿参数的模型。Mamoda2.5 在 VBench 2.0 的视频编辑质量方面表现出顶级性能,超越了开源模型,并可与 Kling O1 等专有模型相媲美。…