SDXL
PulseAugur coverage of SDXL — every cluster mentioning SDXL across labs, papers, and developer communities, ranked by signal.
- instance of SD3.5 90%
- competes with ComfyUI 70%
- instance of Flux 70%
- used by Flux 70%
- used by LoRA+ 70%
- instance of StableDiffusion 70%
- instance of SD1.5 70%
- instance of Stable Diffusion 3 70%
- used by Z Image Turbo++ 70%
- used by StableDiffusion 70%
- instance of Z Image Turbo++ 70%
- used by Z Image 70%
13 天有情绪数据
Optimization techniques for diffusion models like SDXL to become a key focus
The evidence suggests that speed and cost efficiency in diffusion models are achieved through overhead reduction and pipeline optimization, rather than solely through model architecture changes. As models like SDXL become more prevalent, there will be increased research and development into techniques like `torch.compile`, fused attention, and quantization to make their inference faster and cheaper, similar to Photoroom's cost-cutting measures.
SDXL adoption in open-source media generation workflows to increase
The successful use of SDXL in an open-source workflow for generating a 'Pirate Movie' beta trailer suggests a growing trend. As more creators explore fully open-source pipelines for media production, SDXL's capabilities in generating base images will likely be leveraged in similar projects, potentially leading to more complex and ambitious open-source film and animation endeavors.
SDXL's local anime generation capabilities are a notable specialization
The release of a new SDXL model specifically excelling at generating anime-style images locally highlights a trend towards specialized AI models for artistic niches. This suggests that while general-purpose models are powerful, there is significant value and demand for models fine-tuned for specific aesthetic styles like anime, catering to artists and hobbyists.
-
新的AI技术为复杂的摩尔纹去除生成训练数据
研究人员开发了一种新方法,为旨在去除图像中复杂摩尔纹的人工智能模型生成高质量的训练数据。该方法利用生成式基础模型创建逼真的摩尔纹图案及其对应的干净版本,解决了从现实场景中获取配对数据的挑战。由此产生的WildMoiré数据集包含6.8K个训练对,已被证明能显著提高ESDNet、SDXL和Qwen Image Edit等现有去摩尔纹模型的性能。
-
Nexus模型提供与SDXL相当的高效文本到图像生成
研究人员推出了一种新颖的文本到图像生成模型Nexus,旨在提高效率。Nexus集成了稀疏架构、线性复杂度和低比特量化,结合了MoE前馈层和门控DeltaNet注意力。这种方法使Nexus在生成质量上可与SDXL和Stable Diffusion 3等成熟模型相媲美,同时显著提高了推理速度并降低了内存需求。在COCO和Laion数据集上进行的实验验证了其有效性。
-
MagnifiQ框架实现4K图像恢复的渐进式放大
研究人员推出了一种新颖的高分辨率图像恢复框架MagnifiQ,能够将图像从1024x1024放大到4096x4096。该方法利用像SDXL这样的预训练扩散模型,通过用线性增长的卷积操作替换自注意力层来调整其架构以实现高效的高分辨率处理。MagnifiQ采用渐进式放大策略和针对特定图像块的文本提示,以确保全局一致性并增强局部细节,在感知质量和用户偏好方面优于现有的基于扩散的恢复技术。
-
Stable Diffusion 用户展示“Other Worlds”项目
一位用户分享了他们的创意项目“Other Worlds”,该项目利用 Stable Diffusion(SDXL 配合 refiner 和 upscaler)进行图像生成,并使用 LTX 2.3 进行动画制作。用户使用了 Cinema 4D 和 Octane 来制作初步的行星视觉效果,并使用配备 64GB RAM 的 RTX 5090 进行渲染。尽管承认存在一些 bug 和闪烁问题,但用户表示享受创作过程,并注意到图像和高分辨率视频的…
-
Regional Prompter 在新的 AI 图像生成架构中出现兼容性问题
Regional Prompter 工具,一种控制 Stable Diffusion 中图像生成区域的流行方法,正面临与 Flux 和 DiT 等较新的 Transformer 架构的兼容性问题。虽然核心插件在 A1111 和 SDXL 等旧模型和接口上仍然可用,但迁移到基于 Flux 的管道的用户发现原始 UNet-attention-hook 机制不受支持。这导致了社区开发的 fork 和 Attention Couple、Flu…
-
新AI图像生成器将支持StableDiffusion、SDXL和GGUF
一款新的AI图像生成工具即将发布,重点关注StableDiffusion、SDXL和GGUF兼容性等功能。该工具旨在提供ComfyUI的替代方案,并强调本地和离线AI能力。
-
NuclearDiffusion 模型增强了核能概念的 AI 图像生成能力
研究人员开发了 NuclearDiffusion,这是一个通过微调开源扩散模型而专门用于核能概念的文本到图像模型。研究发现,微调显著提高了 Stable Diffusion XL (SDXL) 的性能,但对 SD-v3.5-Medium 的影响有限,对 Flux.1 没有任何可衡量的效果,这表明适应效果与生成架构有关,而不仅仅是模型规模。与 GPT-Image-2 和 Midjourney 等商业系统相比,微调后的开源模型为专业的核工…
-
TurboClear模型实现一步式图像物体移除,速度显著提升
研究人员开发了TurboClear,一种新颖的一步式模型,用于从图像中移除物体及其相关效果。这款基于SDXL的模型在训练过程中利用区域校准分布匹配(RDM)来确保区域感知蒸馏并保留不对称的编辑和保留行为。为了实现高效推理,TurboClear集成了可学习空间融合(LSF)。实验表明,TurboClear显著提高了推理速度,与ObjectClear相比计算开销减少高达40倍,与OmniPaint相比减少665倍,同时保持了相当或更优的视觉质量。
-
多款 Android 手机测试运行大型 Stable Diffusion 模型
一项实验性设置正在测试在多款 Android 智能手机上运行大型 Stable Diffusion 模型的能力,旨在克服单设备的内存限制。这种方法虽然无意超越专用 GPU 的性能,但允许用户访问原本无法装入一部手机的模型。为了获得这种扩展容量,需要付出速度显著下降和因设备间的协调及潜在故障点而增加复杂性的代价。
-
AI艺术用户寻求准确复制中世纪木刻风格
一位Reddit用户正在询问是否有可能生成准确复制中世纪木刻插画风格的AI艺术品。他们指出,目前的AI尝试常常达不到要求,看起来像是近似而非真实的历史作品。该用户计划在MacBook M4 Max上使用Kohya_ss GUI和SDXL,但也愿意尝试更简单的解决方案,因为他们在ChatGPT和Gemini等工具上针对这种特定艺术风格的尝试收效甚微。
-
Reddit 用户寻求更快、更高质量的 AI 模型用于人物图像到草图生成
一位 Reddit 用户正在寻求优化其人物图像到草图生成流程的建议。他们正在寻找能够在一秒钟内生成人脸和全身草图的模型,即使在处理批量图像时也是如此。虽然目前使用 Stable Diffusion 1.5 和 SDXL 结合 ControlNets、IPAdapter 和 LoRAs 的方法在保留身份方面很有效,但用户发现全身图像在较低分辨率下面部细节效果不佳。他们正在探索提高草图生成速度和面部细节保留质量的方法。
-
AI音乐和图像生成工具汇总
这篇Mastodon帖子重点介绍了一系列顶尖的AI音乐和图像生成工具。它为对AI艺术和音乐创作感兴趣的机器人和用户提供了一个精选列表,其中包含知名的模型和平台。
-
MaskAttn-SDXL 增强了文本到图像扩散模型中的区域级控制
研究人员推出 MaskAttn-SDXL,这是一个新颖的即插即用模块,旨在增强文本到图像扩散模型中可控的区域级生成。该模块将 token 条件的空间门控注入到 SDXL 等现有模型的交叉注意力机制中,而无需更改核心架构或采样过程。通过稀疏化 token 与位置的交互,MaskAttn-SDXL 旨在抑制不相关的绑定并提高组合的可靠性,从而解决全局指标常常无法捕捉的属性混合和空间关系违规等问题。
-
Stable Diffusion XL (SDXL) 模型迎来三周年纪念
Stability AI 于 2023 年发布的 Stable Diffusion XL (SDXL) 模型正在庆祝其三周年纪念。SDXL 相较于早期版本有了显著的进步,提供了更强的提示理解能力和原生的 1024x1024 图像生成能力。此后,它已成为众多社区开发的微调版本的基石模型。
-
面向消费级 GPU 的免费 SDXL 和 Anima 训练器已发布
一位开发者创建了 Aozora,这是一个免费的图形用户界面训练器,用于 SDXL 和 Anima 微调,专为在 VRAM 有限的消费级 GPU 上运行而设计。该训练器可以在 11.8 GB VRAM 内高效微调 SDXL 的 UNet,并在约 11.4 GB VRAM 下以 1152x1152 分辨率微调 Anima。Aozora 公开了学习率曲线和损失加权等关键训练参数,旨在简化没有高端硬件的用户的微调过程。
-
需要AI来生成一致的3D模型参考视图
一位Reddit用户正在寻找一种能够从单一正面照片生成人物一致的侧面和背面视图的AI工具或工作流程。已识别出的主要挑战是,现有的AI图像生成模型在创建新视角时,经常会改变人物的姿势、身体比例或服装细节。用户的目标是在不需要完整3D重建的情况下,获得一致的3D建模参考图像。
-
新的光谱对齐方法解决了扩散模型的曝光偏差问题
研究人员开发了光谱对齐(SPA)方法,这是一种解决扩散模型中曝光偏差的新颖技术。该技术将中间预测的功率谱校准到预先计算好的先验,从而提高了迭代采样过程中的准确性。SPA是一种轻量级的、基于引导的方法,计算开销极小,并且可以与Classifier-Free Guidance (CFG) 等现有方法互补。该方法已在DDPM、ADM、SD2.0、SDXL、SD3.5和FLUX等各种扩散模型架构上展示了持续的改进。
-
AI图像生成用户结合Krea 2和Flux以增强细节
一位Reddit用户分享了一种结合两种不同AI图像生成模型Krea 2和Flux以获得更好结果的技术。通过将Krea 2的输出输入Flux,用户能够克服Krea 2在细节和真实性方面的局限性,同时利用Flux处理高分辨率和人体结构的能力。据报道,这种两阶段过程的生成时间与之前的方法相似。
-
新方法利用强化学习加速扩散模型推理
研究人员开发了一种新方法,称为曲率自适应一致性流匹配(CACFM),用于加速扩散模型推理。CACFM 利用强化学习代理动态优化采样轨迹,专注于概率流 ODE 的关键区域。该方法与流自适应 DMD 和对抗性一致性目标相结合,在 FLUX 和 SDXL 等大型模型上取得了最先进的成果,提高了少步生成中的细节保留能力。
-
用户寻求 RTX 4060 8GB 最佳本地 SDXL 模型
一位 Reddit 用户正在寻找在配备 8GB 显存的 NVIDIA RTX 4060 上本地运行的最佳 Stable Diffusion XL (SDXL) 模型推荐。用户的首要目标是生成写实的人物图像,包括肖像和日常照片,用于 SillyTavern 和 Stable Diffusion WebUI Forge Neo。他们正在寻找能够生成高质量写实人物、提示词遵循性好、显存占用合理且具有更大创作自由度的模型,并偏好基于 SDXL 的选项。