SDXL
PulseAugur coverage of SDXL — every cluster mentioning SDXL across labs, papers, and developer communities, ranked by signal.
- instance of SD Negeri 1.5 Belimbing 90%
- instance of SD3.5 90%
- used by Flux 70%
- instance of Flux 70%
- competes with Flux 70%
- instance of StableDiffusion 70%
- used by LoRA+ 70%
- competes with ComfyUI 70%
- instance of Stable Diffusion 3 70%
- used by U-Net 70%
- used by Qwen-Image 2.1 70%
- competes with Midjourney 70%
10 天有情绪数据
Optimization techniques for diffusion models like SDXL to become a key focus
The evidence suggests that speed and cost efficiency in diffusion models are achieved through overhead reduction and pipeline optimization, rather than solely through model architecture changes. As models like SDXL become more prevalent, there will be increased research and development into techniques like `torch.compile`, fused attention, and quantization to make their inference faster and cheaper, similar to Photoroom's cost-cutting measures.
SDXL adoption in open-source media generation workflows to increase
The successful use of SDXL in an open-source workflow for generating a 'Pirate Movie' beta trailer suggests a growing trend. As more creators explore fully open-source pipelines for media production, SDXL's capabilities in generating base images will likely be leveraged in similar projects, potentially leading to more complex and ambitious open-source film and animation endeavors.
SDXL's local anime generation capabilities are a notable specialization
The release of a new SDXL model specifically excelling at generating anime-style images locally highlights a trend towards specialized AI models for artistic niches. This suggests that while general-purpose models are powerful, there is significant value and demand for models fine-tuned for specific aesthetic styles like anime, catering to artists and hobbyists.
-
AI 艺术展展示 Flux-Pro-Ultra、Dreamshaper、SDXL 模型
一位用户分享了在 2024 年至 2025 年间创作的一系列 AI 生成图像,其中包含 Flux-Pro-Ultra、Dreamshaper 和 SDXL 等模型。该帖子还呼吁安装一个利用 Gemini API 的 AI 检测工具。
-
免费 LoRA Trainer Studio 新增对 ERNIE-Image、rsLoRA 和云训练的支持
AcademiaSD 发布了其免费 LoRA Trainer Studio 的更新版本,这是一个用于训练自定义图像生成模型的工具。新版本显著扩展了其兼容性,现在支持包括 ERNIE-Image、Qwen-Image 2.1 和 SDXL 在内的 10 个不同模型家族。主要新功能包括对 rsLoRA、LoRA+ 和 LoKr 训练方法、通过 RunPod 的云训练能力以及用于数据集管理和模型训练的远程浏览器访问。
-
Fizgig 7 增加 Anima 和 SDXL 模型,增强微调功能
Fizgig 7 已发布,引入了对 Anima 和 SDXL 模型 的支持。此次更新具有增强的微调功能,允许用户在仅需 8GB VRAM 的情况下训练包括 Anima 和 SDXL 在内的各种模型。新版本还包括一个模型驱动程序系统,使社区能够添加对新模型或旧模型 的支持,Anima 和 SDXL 是首批使用该系统 的模型。
-
新的诊断工具揭示扩散模型中的控制-修复分离
研究人员开发了一种新的方法来诊断和控制文本到图像扩散模型中的失败,特别是在组合任务中。他们引入了一个仅文本的组合压力指数(CSI)来识别 SD1.5、SDXL 和 Stable Diffusion 3 等模型中常见与罕见的组合。他们的研究发现,虽然组合缺陷可以在去噪过程之前诊断出来,但揭示这些风险的具体坐标并不总是能改善生成的坐标,这表明诊断和控制之间存在分离。
-
用户寻求 Stable Diffusion 工作流以创作生动的手绘风景艺术风格
一位 Reddit 用户正在寻求指导,如何在图像生成中复制一种特定的艺术风格,该风格以生动的色彩、细致的线条和独特的色调区域为特征,而非照片写实主义。他们正在尝试各种 Stable Diffusion 模型和工作流,包括 Flux、SDXL 和 Illustrious,但尚未达到理想的绘画、插画外观。用户正在寻找一个经过测试的配方或工作流,以生成这种独特的视觉语言,他们打算以此为基础进行手绘。
-
AI图像生成用户怀念旧模型和技术
Reddit上的r/StableDiffusion板块发布了一个帖子,邀请用户分享他们对早期AI图像生成模型和技术的体验和回忆。讨论旨在记录该领域的快速发展,突出可能因技术进步而过时的细微或不寻常的方法。鼓励用户回顾他们在使用Stable Diffusion、SDXL等模型以及Midjourney、DALL·E 3等竞争对手,以及ControlNet等工具和各种定制方法(Loras)过程中的个人经历。
-
免费LoRA训练器支持9个模型,最低4GB显存
一款名为 AcademiaSD LoRAlab Trainer Studio 的全新、免费、一体化LoRA训练器已发布,专为显存仅为4GB的消费级GPU设计。该工具支持训练多种模型,包括 Qwen-Image 2.1, FLUX.2 Klein 9B, Krea 2, Z-Image, Ideogram 4, Anima, SDXL 变体, LTX 2.3 和 MiniMax-H3。该训练器具备自动字幕、实时预览和一键导出至 Comf…
-
开源AI工具在用户体验上超越商业视频模型
一位Reddit用户分享了他们使用Qwen进行图像生成和Minimax H3进行视频连续性等开源AI模型组合,在单块RTX 4080 GPU上创建4K视频项目的经验。他们发现这种方法比商业视频生成模型更快、更有效,并怀疑商业模型故意引入错误以鼓励用户消耗积分。整个演示场景,从概念到最终放大,都在一个晚上完成。
-
Stable Diffusion 用户分享云渲染纹理一致性工作流程
一位Reddit用户分享了一个在云端渲染Stable Diffusion图像时保持纹理一致性的详细工作流程。该用户发现,标准的Web界面在渲染过程中常常会丢失精细细节并使美学效果变得平滑。通过使用多ControlNet堆栈的SDXL在本地生成初始几何图形,然后利用MiniMax H3云模型,并进行诸如“环境锁定”之类的特定提示调整以及电影级光照参数,该用户成功实现了纹理一致性。
-
开源Vison应用支持本地AI图像和视频生成
一款名为Vison的新型开源Windows应用程序已被开发出来,用于本地图像和视频生成,支持SDXL、FLUX和Wan等模型。该应用程序具有内置的模型加载器,可接受Hugging Face链接并自动检测兼容模型。它设计运行在至少6GB显存的系统上,并通过Vulkan支持NVIDIA、AMD和Intel GPU,无需账户或遥测。
-
新的DMAD方法通过对抗性蒸馏加速视觉生成
研究人员推出了一种新颖的、用于更快视觉生成的方法DMAD,该方法将分布匹配重新构建为分类问题。该方法无需辅助扩散模型即可训练学生模型,直接通过对抗性蒸馏学习对数密度比。DMAD在ImageNet-64x64和COCO-10K等基准测试中取得了最先进的成果,并在联合音频视频生成任务中表现出强大的性能。
-
Stable Diffusion 用户质疑继续使用旧模型而非新基础模型
Reddit r/StableDiffusion 社区的一位用户正在询问,为什么像 "illustrious/pony" 这样的旧 Stable Diffusion 模型仍然比 "Krea.2" 这样的新基础模型更受欢迎。用户想知道是什么让旧的 SDXL 模型如此吸引人,以及新模型是否因为资源消耗过大而难以进行类似的微调。
-
新的一键式 AI 图像生成器 PinholeAI 简化本地生成
一位软件工程师开发了一款名为 PinholeAI 的新型用户友好型本地图像生成工具,该工具基于 stable-diffusion.cpp 引擎构建。该工具旨在通过消除复杂的节点图和广泛的参数调整来简化图像生成过程,为用户提供一键式体验。PinholeAI 支持多种模型,包括 Qwen-Image 2.1、Z-Image Turbo、SDXL 和 SD 1.5,并内置了 CivitAI 浏览器用于模型选择。该应用程序注重隐私,所有处理和…
-
AI与Web开发:异步作业、模型路由和应用开发
该集群涵盖了与AI和Web开发相关的各种技术实现和项目。其中一篇文章讨论了使用异步作业处理来提高长任务的可靠性,另一篇文章详细介绍了“shadow”如何通过在Flux、SDXL和Runware模型之间进行路由来实现合成图像生成,从而避免供应商锁定。第三篇文章重点介绍了为大学挑战创建的“AWS公共IP范围导航器”应用程序。
-
AI 图像生成在 ComfyUI 中难以保持角色一致性
一位用户在为插画故事生成多张 AI 图像时,在保持角色一致性方面遇到了重大挑战。尽管使用了 ComfyUI、SDXL、Flux 和 IP-Adapter 等工具,但他们仍然遇到了身份和解剖结构漂移的问题,尤其是在不同的姿势和服装变化时。用户尝试了各种方法,包括训练自定义 LoRA 和使用参考条件,但即使使用 SFW 基准图像,也尚未实现稳定的一致角色表示工作流程。
-
ShieldCLIP框架增强多模态模型的安全对齐
研究人员推出ShieldCLIP,一个旨在通过选择性处理有害内容来增强多模态基础模型安全对齐的新型框架。与以往将所有生成样本都视为不安全的先前方法不同,ShieldCLIP根据单个模态的安全状态进行区分。该方法得到了ViSUv2的支持,这是一个具有按模态安全标签的新数据集。ShieldCLIP已证明在减少各种任务中的有害输出方面是有效的,包括使用Stable Diffusion v1.4和SDXL等模型的跨模态检索和文本到图像生成,同…
-
新的ReGain方法改进了扩散模型中合成图像的个性化效果
研究人员开发了一种名为ReGain的新方法,以提高文本到图像扩散模型生成的个性化图像的保真度。当模型在合成图像上进行微调时,它们往往会产生过饱和的颜色和过多的高频细节,这个问题被追溯到分类器自由引导(CFG)。ReGain是一种采样时间校正方法,可以缩小引导中膨胀的频率带,而无需真实照片。应用于Stable Diffusion v1.5后,ReGain成功地缩小了与在真实图像上训练的模型相比,主体保真度差距的很大一部分,同时在SDXL…
-
指南详述了使用 LoRA Pilot 训练 SDXL 风格 LoRA
一份指南详细介绍了如何使用 LoRA Pilot(一个为此目的设计的工具)训练 Stable Diffusion XL (SDXL) 风格 LoRA。该过程包括准备一个包含大约 24 幅插图的数据集,这些插图具有一致的线条、色彩处理和纸张纹理。用户需要为 LoRA 的输出设定明确的目标,并在 LoRA Pilot 的 TrainPilot 组件中正确配置工作区和基础模型,然后使用 TagPilot 为数据集添加字幕。
-
DMAD 通过对抗蒸馏加速视觉生成
研究人员开发了 DMAD,一种新颖的对抗蒸馏方法,可显著加快视觉生成过程。与需要辅助扩散模型的先前技术不同,DMAD 使用判别器直接学习对数密度比,从而实现更快的训练和推理。该方法在图像、视频和音视频生成方面取得了最先进的成果,在 ImageNet-64x64 上单步实现了 1.04 FID 等令人印象深刻的性能指标。
-
研究发现:文本到图像AI模型存在持续的性别偏见
一篇新发表在arXiv上的研究论文揭示,包括Stable Diffusion不同代际在内的文本到图像AI模型,在职业方面表现出显著的性别刻板印象。研究发现,76.4%的生成图像描绘了男性主体,历史上女性编码的职业被男性主体不成比例地代表。从Stable Diffusion 1.5到SDXL,偏见有所加剧,但在SD 3 Medium上略有改善,这表明更新的模型不一定更公平。与美国劳工统计局的数据相比,这些模型低估了女性的比例,尤其是在科…