PulseAugur
中
实时 09:40:41
实体 Text-to-Video (T2V) models

Text-to-Video (T2V) models

PulseAugur coverage of Text-to-Video (T2V) models — every cluster mentioning Text-to-Video (T2V) models across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
3
90 天内 3
发布 · 30天
0
90 天内 0
论文 · 30天
3
90 天内 3
层级分布 · 90 天
主题
最近 · 第 1/1 页 · 共 3 条
  1. TOOL · CL_154599 ·

    新数据集和模型推动AI生成视频质量评估进展

    研究人员推出了HVEval+,这是一个用于评估AI生成的人类中心视频质量的大型数据集,在先前HVEval数据集的基础上增加了成对偏好标注。该新数据集包含1000个提示、来自24个文本到视频模型的视频,以及涵盖空间质量、时间质量和文本-视频对应关系的广泛人工标注。除了数据集,研究团队还提出了MoE-Rater,这是一种基于多模态大型语言模型的评估方法,旨在单一框架内实现多维度质量评分、比较和问答。

  2. TOOL · CL_148006 ·

    新的SIRUS框架可在文本到视频模型中实现概念移除

    研究人员开发了SIRUS,一个新颖的框架,旨在在推理时从文本到视频(T2V)模型中移除特定概念,而无需重新训练模型。该方法可以在不影响非目标元素、时间连贯性和整体视频质量的情况下,定位并抑制跨帧的目标概念。还引入了一个新的以视频为中心的评估框架,用于衡量概念遗忘、非目标保留和视频质量,证明了SIRUS在CogVideoX和Wan2.2等模型上优于VideoEraser等现有方法。

  3. RESEARCH · CL_111331 ·

    Disco-LoRA框架实现多概念视频定制

    研究人员推出Disco-LoRA,一个旨在增强文本到视频模型中多概念视频定制的新框架。该方法通过两阶段过程解耦内容、风格和运动,系统地解决了同时控制这些元素所面临的挑战。Disco-LoRA采用迭代双LoRA解耦框架和基于Z分数的统计正则化来协调权重分布,从而实现更有效和可控的视频生成。