PulseAugur
实时 11:03:16
实体 OpenS2V-Eval

OpenS2V-Eval

PulseAugur coverage of OpenS2V-Eval — every cluster mentioning OpenS2V-Eval across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
1
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
1
90 天内 3
层级分布 · 90 天
主题
情绪 · 30 天

1 天有情绪数据

最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_247905 ·

    新的DIAL框架增强了可控的多主语视频生成

    研究人员开发了一个名为DIAL的新框架,以利用Diffusion Transformers (DiTs) 改进可控的多主语视频生成。DIAL利用DiTs内部发现的内在空间接地图 (ISGM) 来精确地定位主语。该地图在训练期间用于指导注意力,在推理期间用于在不重新训练的情况下控制保真度强度。此外,DIAL采用强化学习和免费生成的首选项对来锚定模型的注意力并防止语义漂移,在OpenS2V-Eval基准测试上显示出显著的改进。

  2. TOOL · CL_118160 ·

    RefAlign 框架通过特征对齐增强了参考到视频的生成

    研究人员推出了一种名为 RefAlign 的新颖框架,旨在改进参考到视频(R2V)生成。该方法明确地将扩散 Transformer 的参考分支的特征与视觉基础模型的特征进行对齐。对齐过程旨在增强主体身份的一致性,并提高不同主体之间的语义可区分性,从而减少复制粘贴伪影和多主体混淆等问题。RefAlign 仅在训练期间应用,不会产生推理时间开销,并在 OpenS2V-Eval 基准测试中展示了卓越的性能。

  3. RESEARCH · CL_53558 ·

    新型量化方法大幅降低视频 Transformer 内存占用

    研究人员开发了一种新的训练后量化框架,名为 Timestep-Aware SVDQuant-GPTQ,以解决大型视频扩散 Transformer 中的内存挑战。该方法专门针对 W4A4 量化,后者可显著节省内存,但由于激活值异常和依赖于时间步长的分布而变得复杂。该框架旨在处理 Wan2.2-I2V 的混合专家设计中两个专家的不同量化敏感性,从而在对 VBench 和成像质量等性能指标影响极小的情况下,将峰值 GPU 内存减少 59.3%。