Open Sora
PulseAugur coverage of Open Sora — every cluster mentioning Open Sora across labs, papers, and developer communities, ranked by signal.
2 天有情绪数据
-
新的T2VAttack方法揭示了文本到视频扩散模型的漏洞
研究人员开发了T2VAttack,一种探测文本到视频扩散模型漏洞的新方法。该攻击侧重于视频生成的语义和时间两个方面,旨在降低生成视频与其文本提示之间的对齐度,以及视频本身的时间连贯性。T2VAttack采用同义词替换和优化词语插入等策略来扰乱提示,证明即使是微小的改动也会显著损害包括ModelScope和Open-Sora在内的几款领先模型的视频质量和时间动态。
-
开源AI生态系统表现不一,重点工具引人关注
开源AI生态系统正经历波动,OSAI指数显示每日表现各异。有些日子显著增长,有些日子则出现明显下滑,表明这是一个动态且不断发展的格局。OSAI Pulse和Olud Pulse指标突出了特定的工具和类别,其中Ollama、LangFlow、Generative AI for Beginners和vLLM因其采用率和增长而受到认可。
-
阿里巴巴发布开源视频生成套件 Wan 2.1
阿里巴巴的 Wan 团队发布了 Wan 2.1,这是一个开源视频生成模型套件,旨在让高质量视频生成更加易于获取。该套件包括文本到视频、图像到视频和视频编辑功能,其参数大小针对高端和消费级 GPU 进行了优化。Wan 2.1 采用了一种 Diffusion Transformer 架构,并配备了一种新颖的视频变分自编码器,该编码器可保持时间因果关系以减少闪烁伪影,并支持中文和英文文本提示。
-
NaviCache 通过新颖的自校准技术加速视频生成
研究人员推出了一种名为 NaviCache 的新颖方法,旨在通过解决视频扩散模型 (VDM) 的计算成本来加速视频生成。与依赖离线校准或瞬时近似的先前方法不同,NaviCache 采用了一种测试时间自校准技术。它将特征演化建模为惯性导航系统 (INS) 问题,自适应地跟踪特征变化及其潜在漂移,从而实现有误差界限的计算跳过。在 HunyuanVideo 和 Open-Sora 等数据集上的实验表明,NaviCache 提高了计算跳过的准…
-
新研究解决了视频生成在控制、一致性和效率方面的挑战
研究人员正在开发先进的视频生成技术,重点是提高控制、一致性和效率。CineOrchestra 旨在统一对电影视频中主体、摄像机和镜头转换的控制。TetherCache 通过管理缓存内存来解决长格式自回归视频生成中的漂移和质量下降问题。Argus 使用新颖的身份注入方法来增强在各种挑战性条件下的主体保留能力。MilliVid 采用分层潜在空间来实现长程一致性,而 RhymeFlow 通过解耦去噪轨迹来加速扩散变换器。Echo-Infin…