Wan2.2
PulseAugur coverage of Wan2.2 — every cluster mentioning Wan2.2 across labs, papers, and developer communities, ranked by signal.
9 天有情绪数据
-
Reddit 讨论开源图像生成模型
Reddit 上 r/StableDiffusion 版块的讨论探讨了最佳开源图像生成模型。讨论指出,虽然开源 AI 在大型语言模型(LLMs)和视频方面表现出色,但在图像生成领域,仍有领先的闭源选项。用户推荐了 Krea2 等模型用于通用场景,Ideogram4 用于文本和品牌设计,Flux Klein 9b 用于编辑,Z-image 用于写实风格,以及 Anima/Illustrious 用于动漫风格。大家普遍认为,一个结合 Kr…
-
MiniMax H3 可用于个人媒体服务器模仿,用户报告
一位 Reddit 用户分享了他们使用 MiniMax H3 为其 Plex 媒体服务器创建模仿内容的经验,突出了该模型在个人使用方面的能力。他们指出,自早期版本以来,开源模型已取得显著进步,并将当前技术比作拥有一个个人 Sora。
-
新的手术世界模型增强了机器人学习和视频生成能力
两篇新的研究论文,Surgical WAM 和 Surg-UniWorld,引入了用于手术机器人技术的高级世界模型。Surgical WAM 通过在无动作视频上进行预训练来学习视觉动力学,从而提高数据效率,然后在有限的标记演示下增强闭环操作。Surg-UniWorld 提出了一种统一的多模态方法,使用分层锚点和相对模态专家来生成逼真且可控的手术视频,在一个新的基准测试中表现优于现有方法。
-
新EmoWorld框架提供可控情感视频生成
研究人员开发了EmoWorld,一个旨在增强视频生成中情感控制的新框架。该系统将通常纠缠在现有视频生成模型中的全局氛围、语义情感线索和时间进程解耦。通过与冻结的流匹配视频扩散 transformer (Video DiT) 集成,EmoWorld 使用视觉氛围引导 (VAS)、语义情感引导 (SAS) 和时间情感引导 (TAS) 来独立控制这些情感元素。在 Wan2.2 数据集上的评估显示,情感一致性和时间一致性有显著提高,EmoWo…
-
机器人可能不需要专用大脑,而是利用视频模型
一篇新论文介绍了一种名为 Masked Visual Actions (MVA) 的方法,该方法通过利用视频生成模型来统一机器人的世界建模和动作生成。MVA 不训练专门的机器人基础模型,而是将动作视为视频帧内的掩码轨迹,从而使机器人能够直接利用成熟的视频模型。这种方法只需要极少的微调,在不同机器人硬件上展现出强大的零样本泛化能力,并为工业自动化中的跨体挑战提供了潜在解决方案。
-
新的CAPE-T2V框架增强文本到视频生成的对齐
研究人员推出CAPE-T2V,一个旨在通过解决训练字幕和推理时提示之间的不匹配来改进文本到视频生成的新框架。该系统首先微调一个提示增强器(PE),从源字幕生成各种目标提示。随后,它使用这些增强的字幕微调文本到视频扩散变换器(DiT),确保PE的输出与DiT的训练数据之间更好的对齐。这种方法在StoryEval和VBench 2.0等基准测试中提高了性能,并显示出“PE-字幕差距”的减小。
-
新的 DAR 方法使视频模型能够渲染 4D 场景
研究人员开发了 DAR,这是一种新颖的方法,使预训练的视频扩散模型能够充当 4D 渲染器。该方法使用动画网格、相机轨迹和参考图像来约束这些模型,从而实现考虑相机运动和内部对象动画的场景生成。DAR 投影一个神经 4D G-缓冲区,其中包含跟踪、世界位置和法线信息,然后通过加宽的控制适配器将其集成到模型中。在 DAR-4D 基准测试上的评估表明,与 Wan2.2-Depth 等现有方法相比,PSNR、SSIM 和 LPIPS 有显著提高。
-
用户分享使用 Wan2.2 模型生成的第一个视频
一位 Reddit 用户分享了他们使用 Wan2.2 模型进行图像生成和视频创作的初步体验。他们详细介绍了自己的学习历程,从基础的移动端 AI 编辑器到更高级的工具,如 AUTOMATIC1111、Flex、Flux,最终到 Wan。用户强调了使用 Flux 和 Wan 创建了一个 Lora 角色,并随后使用 Wan2.2 的 i2v 模型生成短视频片段,同时指出了生成时间和硬件限制。
-
MXAttention 框架优化 MXFP4 注意力以用于视频生成
研究人员开发了 MXAttention,这是一个新颖的、无数据的训练后量化框架,旨在优化基于扩散的视频生成模型中的 MXFP4 注意力。该框架解决了数值问题,如裁剪-下溢权衡和归一化错误,这些问题通常会降低生成质量。MXAttention 结合了通用最优缩放 (UOS) 以实现独立于分布的缩放,以及预归一化量化 (PNQ) 以保持归一化精度。实验表明,MXAttention 显著缩小了 MXFP4 和 FP16 格式之间的质量差距,以…
-
LTX 2.3用户报告Dr34mL4Y LoRA存在身体比例问题
LTX 2.3图像到视频模型的用户在保持身体和面部比例一致性方面遇到问题,特别是乳房尺寸在视频生成过程中似乎会缩小。这个问题似乎与使用特定的LoRA有关,例如Dr34mL4Y LoRA,而较旧的版本如WAN2.2则没有表现出这种行为。问题出现在生成视频的最初几秒钟之后,导致结果看起来不自然。
-
用户寻求超越 Wan2.2 的高级视频编辑 AI 模型
一位 Reddit r/LocalLLaMA 版块的用户正在寻找在视频编辑模型方面优于 Wan2.2 的推荐。他们询问社区目前有哪些替代方案以及大家正在使用哪些工具,并提到他们拥有一张 RTX 3090 显卡。
-
用户寻求关于使用 Wan2.2 和 sky reel 的 AI 项目的反馈
Reddit 的 r/StableDiffusion 子版块的一位用户正在寻求对其最近项目的反馈,该项目涉及“Wan2.2”和“sky reel”技术的集成。用户对在“Wan2.2”上实现正确的唇部同步和控制表示满意,这表明开发过程成功。
-
新的SIRUS框架可在文本到视频模型中实现概念移除
研究人员开发了SIRUS,一个新颖的框架,旨在在推理时从文本到视频(T2V)模型中移除特定概念,而无需重新训练模型。该方法可以在不影响非目标元素、时间连贯性和整体视频质量的情况下,定位并抑制跨帧的目标概念。还引入了一个新的以视频为中心的评估框架,用于衡量概念遗忘、非目标保留和视频质量,证明了SIRUS在CogVideoX和Wan2.2等模型上优于VideoEraser等现有方法。
-
FlashDecoder: 基于 Transformer 的视频解码器实现实时生成
研究人员开发了 FlashDecoder,这是一种新颖的、基于 Transformer 的视频解码器,专为实时生成而设计。与使用缓慢且内存密集型 3D 卷积解码器的现有模型不同,FlashDecoder 通过滚动 KV 缓存处理过去帧的固定大小窗口中的帧。这种方法可确保恒定延迟的流式传输,并保持与卷积解码器相当的重建质量,即使在 1080p 等高分辨率下也是如此。与传统方法相比,FlashDecoder 在 H100 GPU 上展示了…
-
在您的服务器上部署LTX-2视频生成模型
本文提供了一个关于如何在服务器上部署LTX-2视频生成模型的指南。它解决了将Wan2.2模型集成到自定义项目中的困难,并提供LTX-2作为从文本或音频生成视频的更直接的替代方案。
-
新的Web UI支持在低显存GPU上进行AI图像生成
一个名为LiteUI-Studio的新开源Web UI已被开发出来,可以在只有6GB或8GB显存的显卡上运行特定的AI图像生成模型,包括LTX2.3、Wan2.2-A14B和Flux.2-Klein-9B。该工具使用ComfyUI作为其后端,旨在提供一个轻量级的界面,无需复杂的节点设置。它支持加载微调模型和LoRA,在8GB显存上进行Flux2文本到图像任务的典型生成时间约为30秒,尽管目前它存在一些限制,例如缺少IPAdaptor和…
-
AI工作站配置:4x RTX 5090 对比 1x RTX 6000 Blackwell
一位用户正在为YouTube自动化和数据蒸馏等商业应用寻求高端AI工作站的配置建议。他们正在权衡两种GPU配置:四块RTX 5090显卡,总计128GB显存,或一块RTX 6000 Blackwell显卡,拥有96GB显存。用户担心多GPU分片用于视频生成和微调的实际操作性,以及单块大显存显卡的简便性,尤其是在成本相似的情况下。
-
LanPaint 集成 Krea2 Turbo 以增强扩散模型修复
LanPaint 是一款通用的图像修复和外绘工具,现已支持 Krea2 Turbo。Krea2 Turbo 是一个快速的文本到图像模型,具备 LoRA 和提示增强功能。此次集成使用户能够通过加载图像、绘制蒙版和编写提示来轻松执行图像修复。LanPaint 旨在与各种扩散模型配合使用,特别是那些可能缺乏专用修复变体的新型模型,同时也支持 Ideogram4、Flux2 Klein、Anima、Z-image、Qwen Image Edi…
-
Reddit 用户分享两年 Stable Diffusion 工作流合集
一位 Reddit 用户分享了他们两年间积累的 Stable Diffusion 工作流的广泛合集,并声称这些工作流仍然有效。他们强调了 LoRA(低秩适配)作为优化图像生成过程的宝贵工具的效用。
-
用户寻求为Wan2.2视频添加带唇同步的角色声音,要求不损失质量
Reddit上的用户正在寻求方法,为使用Wan2.2生成的视频添加带唇同步的角色声音,同时不降低原始视频质量。使用InfiniteTalk和LTX2.3等工具的尝试导致视频质量严重下降或原始素材被改变。虽然可以无问题地添加背景音频,但如何在保持初始视频完整性的同时集成角色声音和唇同步仍然是一个挑战。