CogVideoX
PulseAugur coverage of CogVideoX — every cluster mentioning CogVideoX across labs, papers, and developer communities, ranked by signal.
- 2026-07-19 research_milestone A physics-consistency checker identified a failure mode in the CogVideoX-5b-I2V model where generated objects failed to fall as expected. 来源
3 天有情绪数据
-
新的LFV方法可加速视频VAE潜在空间的光谱编辑
研究人员开发了一种名为潜在频率有效性(Latent-Frequency Validity, LFV)的新方法,可在视频VAE潜在空间中实现更快、更精确的光谱编辑。该技术无需进行完整的解码-过滤-重新编码循环,即可控制噪声、闪烁和流畅度。LFV通过学习特定于VAE的光谱响应并有选择地应用它来实现这一点,从而显著降低计算成本并提高各种视频生成模型的保真度。
-
新的T2VAttack方法揭示了文本到视频扩散模型的漏洞
研究人员开发了T2VAttack,一种探测文本到视频扩散模型漏洞的新方法。该攻击侧重于视频生成的语义和时间两个方面,旨在降低生成视频与其文本提示之间的对齐度,以及视频本身的时间连贯性。T2VAttack采用同义词替换和优化词语插入等策略来扰乱提示,证明即使是微小的改动也会显著损害包括ModelScope和Open-Sora在内的几款领先模型的视频质量和时间动态。
-
CachedSearch 通过新颖的缓存加速视频扩散模型搜索
研究人员开发了 CachedSearch,一种新颖的、无需训练的方法,用于加速视频扩散模型的测试时搜索。该技术通过积极缓存中间结果,显著降低了生成高质量视频输出的计算成本,使每次运行速度提高 2-3 倍,而质量没有明显下降。CachedSearch 通过缓存探索候选结果,然后仅以完整计算重新生成最佳结果,从而在降低成本的同时捕获了完整搜索超过 94% 的收益。该方法已被证明在各种模型尺寸和架构(包括 Wan、LTX、CogVideoX…
-
AI 视频模型 CogVideoX-5b-I2V 未通过物理一致性测试
一个独立的物理一致性检查器 Haga 识别出了 CogVideoX-5b-I2V 模型的一个失效模式。当提示模型生成“球和积木掉落”场景时,模型生成的视频中物体保持悬空,运动极少,而不是掉落。使用一个冻结的检测器进行的预注册测试证实了在九个独立的视频片段中有 100% 出现这种“静态悬停”失效,而真实的物理场景视频未受影响。
-
新的SIRUS框架可在文本到视频模型中实现概念移除
研究人员开发了SIRUS,一个新颖的框架,旨在在推理时从文本到视频(T2V)模型中移除特定概念,而无需重新训练模型。该方法可以在不影响非目标元素、时间连贯性和整体视频质量的情况下,定位并抑制跨帧的目标概念。还引入了一个新的以视频为中心的评估框架,用于衡量概念遗忘、非目标保留和视频质量,证明了SIRUS在CogVideoX和Wan2.2等模型上优于VideoEraser等现有方法。
-
Stable Diffusion 用户为新的 16GB GPU 寻求模型推荐
一位 Reddit 用户正在为使用新的显卡(RX 6800 XT,拥有 16GB 显存)寻求 Stable Diffusion 模型推荐。他正在从 RX 6600 升级,并有兴趣探索各种图像和视频生成模型。用户特别提到了对 SDXL、Flux、SD 3.x、Hunyuan、Wan 和 CogVideoX 的兴趣,并对其他适合增加内存容量的模型持开放态度。
-
ACID方法通过动态缓存加速视频生成
研究人员开发了ACID,一种新颖的自适应缓存方法,旨在加速扩散模型的视频生成。与使用固定缓存阈值的现有方法不同,ACID根据漂移信号的变化率动态调整此阈值。这种方法允许在不太关键的去噪步骤中进行更积极的缓存,同时在关键步骤中保持高质量。在与流行的缓存技术和开源视频模型进行测试时,ACID在视觉质量几乎没有下降的情况下,展示了比基线方法显著的速度提升。
-
OrbitQuant 实现扩散 Transformer 的数据无关量化
研究人员开发了 OrbitQuant,一种用于扩散 Transformer (DiTs) 的新型训练后量化方法。该技术通过在归一化、旋转基中进行量化来实现高效推理,无需在不同的时间步、提示或模态之间进行重新校准。OrbitQuant 在 FLUX.1、Z-Image-Turbo、Wan 2.1 和 CogVideoX 等图像和视频生成模型的低比特设置下实现了最先进的性能,甚至在 2 位权重下也能实现可用的生成质量。
-
新框架增强了AI视频生成中的物理真实感
研究人员开发了两个新框架Proprio和LaMo,旨在提高AI生成视频的物理真实感。Proprio是一种无需训练的方法,能够让现有的视频生成器对其输出进行自我评估和优化,以达到物理上的合理性。另一方面,LaMo从无标签的训练数据中提取运动线索,创建潜在的运动先验,从而增强视频生成模型中的物理一致性。这两种方法在解决AI视频违反基本物理原理的常见问题方面都显示出潜力。
-
新方法提升视频扩散模型的效率和质量
研究人员正在开发新方法来提高视频扩散模型的效率和质量。几篇论文介绍了优化注意力机制的技术,例如稀疏注意力(LVSA、Veda)和线性注意力(ARL2),以降低计算成本并实现更长的视频生成。其他方法侧重于微调和偏好优化,例如用于时空区域对齐的LocalDPO和通过矢量化时间步长适应来实现时间控制的Pusa V1.0。此外,Q-ARVD解决了自回归视频扩散模型特有的量化挑战,而Bernini则统一了大型语言模型和扩散模型以实现语义规划和渲染。
-
AI研究人员为视频生成模型开发潜在空间探测技术以检测成人内容
研究人员开发了一种新方法,通过分析AI模型内部的潜在空间表示来检测其生成的视频中的成人内容。该方法应用于CogVideoX扩散模型,在生成过程中拦截这些内部信号,并附加轻量级分类器。该系统在一个包含超过11,000个视频片段的数据集上达到了97.29%的F1分数,与分析提示或最终输出的方法相比,展示了更高的检测性能和效率。