LightX2V
PulseAugur coverage of LightX2V — every cluster mentioning LightX2V across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
StableDiffusion 用户寻求关于新的 SLA LightX2V Turbo LoRA 模型的使用指导
一位 Reddit 用户正在寻求关于“SLA”(稀疏线性注意力)版本的“LightX2V Turbo LoRA”模型的信息,特别是用于 StableDiffusion。该用户正在询问如何实现这个据称更快的版本,并寻求在 ComfyUI 中配置它的指导,因为必要的稀疏注意力节点并不明显。
-
新的 LoRA 模型为 MiniMax-H3 提供 2.5 倍的更快推理速度
一个名为 lightx2v/Minimax-h3-Turbo-SLA 的新的 LoRA (Low-Rank Adaptation) 模型已发布,为 MiniMax-H3 模型提供了显著的推理速度提升。该蒸馏模型采用了 85% 稀疏率的稀疏线性注意力 (SLA),在 NVIDIA RTX 5090 上实现了约 2.5 倍的更快推理速度,同时保持了视觉质量。该模型支持 768p FL2V 生成,并兼容 LightX2V 和 ComfyUI…
-
LightX2V 更新适用于 Minimax 框架的 Turbo LoRA
LightX2V 发布了一个更新的 Turbo LoRA 模型,该模型专为 Minimax 框架设计。新版本在 Hugging Face 上可用,为 Stable Diffusion 生态系统中的图像生成任务提供了增强的功能。
-
新的 Minimax H3 Turbo LoRA 加速 Stable Diffusion 视频生成
一款名为 Minimax H3 Turbo 的新 LoRA(低秩适配)模型已发布,为 Stable Diffusion 提供加速的视频生成功能。该 LoRA 由 lightx2v 等人开发,专为 ComfyUI 界面设计,支持文本到视频(Text-to-Video)和图像到视频(Image-to-Video)生成。初步测试表明速度有显著提升,4 步生成可在不到一分钟内完成,尽管一些用户注意到高对比度和音频质量问题,但据报道这些问题正在解决中。
-
MiniMax Turbo Lora (LIGHTX2V) 增强 Ref2V 音频生成
一位 Reddit 用户分享了 MiniMax Turbo Lora (LIGHTX2V) 的配置,该配置改进了 Ref2V 音频功能。该设置涉及使用 lightx2v turbo lora 配合 MiniMax-H3 turbo 套件的 TurboSampler 节点,sigma 偏移量为 12/3,步数为 6。此配置允许从单个参考图像和与视频内容不同的参考音频样本生成视频。用户通过在配备 4070 ti GPU 和 64GB RA…
-
新的 LoRA 适配器增强文本到音频视频生成
一款名为 lightx2v/MiniMax-H3-Prompt-Rewriter-LoRA 的新 LoRA 适配器已发布,旨在增强文本到音频视频(T2VA)的生成。该适配器基于 Qwen3.6-27B 模型构建,可将简短的提示转换为详细、结构化的描述,用于多模态内容创作。配套的 LightX2V 推理引擎为 T2AV 生成等任务提供了优化的本地处理,并提供内存卸载和并行处理等功能。
-
Bernini-R AI 模型展示了有效的视频对象移除能力
一位 Reddit 用户分享了使用 Bernini-R(一款 AI 模型)进行视频对象移除的演示。演示中,用户移除了视频中的悬挂式滑翔翼、安全带和横杆,使其看起来像一个人在飞行。该过程结合使用了 Bernini-R 和 LightX2V,在 720p 分辨率下分 4 个步骤完成。
-
Wan 2.2 14b 的新 NVFP4 检查点声称速度大幅提升
为 Wan 2.2 14b 视频生成模型发布了一个新的检查点模型 NVFP4,声称在速度上有了显著提升。基准测试显示,在 480p 和 720p 等分辨率下,速度提升了 51.9 倍至 59.3 倍。然而,早期示例表明 NVFP4 版本在运动质量方面可能有所下降。
-
SenseNova U1 以新颖的架构统一图像理解和生成
商汤发布了 SenseNova-U1,一个统一图像理解和生成的开源模型。这种新颖的架构,特别是其 8B 参数版本,能够复制之前在 GPT-Image-2 等闭源模型中看到的先进能力,在处理密集文本和复杂布局的任务中表现出色。该模型的核心创新是 NEO-unify 架构,它在一个单一框架内实现了原生的、连续的文本和图像创建,从而能够生成更连贯、更具上下文相关性的视觉输出。