Stable Diffusion XL
PulseAugur coverage of Stable Diffusion XL — every cluster mentioning Stable Diffusion XL across labs, papers, and developer communities, ranked by signal.
- 2026-09-17 research_milestone A research paper details a multimodal framework for generating culturally faithful Ulos motifs using a fine-tuned Stable Diffusion XL model. 来源
2 天有情绪数据
-
AI使用多模态Stable Diffusion XL生成符合文化习俗的Ulos图案
研究人员开发了一个多模态生成框架,通过实现可控且符合文化习俗的图案生成,来帮助传统的巴塔克Ulos编织业。该系统使用LoRA对Stable Diffusion XL进行微调,并与LLaMA 1.5-7B集成,采用四种条件机制:通过ControlNet的文本、图像、表示和语义图。消融研究表明,文本、图像和语义图条件的组合在FID和CLIP Score方面产生了最佳结果,而文本、图像和表示则提供了一种平衡的方法。用户评估证实了统计学上显著…
-
AI艺术家分享风景系列作品,寻求对真实性的反馈
该条目展示了一系列AI生成的图像,主要聚焦于海岸和山地景观。创作者承认图像中的岩石可能不完全真实,但认为它们有助于提升艺术作品的整体美感。创作者正在寻求对该系列的反馈。
-
Re-Experiencing History v2 发布,集成 AI 图像生成用于古代研究
Re-Experiencing History 平台已推出第二版,将 AI 驱动的图像生成与古代历史研究相结合。v2 版本引入了使用各种 AI 模型生成历史场景的功能,包括针对特定历史主题的自定义 LoRA 模型。它还结合了基于 RAG 的提示优化,并包含广泛的研究文献、生成图像的合理性评分系统、工作流程管理和故事板创建。该平台旨在将假设可视化并测试变体,作为研究过程的一部分,但目前仅对苏黎世大学的附属人员开放。
-
NuclearDiffusion 模型增强了核能概念的 AI 图像生成能力
研究人员开发了 NuclearDiffusion,这是一个通过微调开源扩散模型而专门用于核能概念的文本到图像模型。研究发现,微调显著提高了 Stable Diffusion XL (SDXL) 的性能,但对 SD-v3.5-Medium 的影响有限,对 Flux.1 没有任何可衡量的效果,这表明适应效果与生成架构有关,而不仅仅是模型规模。与 GPT-Image-2 和 Midjourney 等商业系统相比,微调后的开源模型为专业的核工…
-
在 Mac 上部署扩散模型面临 NumPy 障碍
作者尝试在 Mac 上部署一个扩散模型,遇到了 NumPy 库的重大挑战。具体来说,将 Stable Diffusion XL (SDXL) 模型导出到 Core ML 的过程出现了问题,NumPy 错误阻止了数组转换为标量值。
-
AI图像生成用户质疑旧版Stable Diffusion模型的价值
一位Reddit用户对投入时间研究旧版Stable Diffusion模型(如SD 1.5和SDXL)的价值提出了质疑,因为AI图像生成技术发展迅速。尽管SDXL仍被认为能够生成独特的艺术图像,但用户发现SD 1.5已基本过时。用户还指出,新款显示器可以揭示以前被认为是逼真的图像中的缺陷,这突显了AI生成艺术质量评估的主观性。
-
用户寻求 SDXL 的替代方案以生成游戏图标
一位 Reddit 用户正在寻找 Stable Diffusion XL (SDXL) 之外的更新的模型或 LoRA 来生成方形游戏图标。他们正在开发一款管理类游戏,并且只找到了较旧的 SDXL LoRA。该问题询问是否有更强大的模型或特定的 LoRA 可以推荐,以生成所需的图标。
-
游戏开发者寻求AI工具以制作AAA级动画
一位Reddit用户正在寻求关于为浏览器游戏创建高质量动画的指导,特别是涉及一个拔枪的蒙面人物的场景。由于缺乏动画或设计经验,他们正在寻求工具、技术和学习资源的建议,以在5-7秒的动画中实现AAA级游戏的美学效果。该用户已尝试使用Three.js和简单的形状,但发现结果不令人满意。
-
AI为堤防检测生成合成砂沸图像
研究人员开发了一种新颖的基于扩散的合成流程,用于生成用于检测土质堤防的合成砂沸图像。该方法利用Stable Diffusion XL,通过DreamBooth进行微调,并由多分支ControlNet控制,以根据有限的真实示例创建逼真的缺陷图像。该流程包含一个软掩码修复协议,以在重新渲染周围场景的同时保持原始缺陷像素,以及一个由分类法驱动的Prompt Atlas用于文本条件控制。该系统生成了超过1000张合成图像,其中815张通过了C…
-
HyFL-CLIP 增强图像-文本对齐能力,以处理长上下文描述
研究人员开发了 HyFL-CLIP,一个旨在增强 CLIP 理解长上下文图像-文本描述能力的新框架。传统的 CLIP 模型由于位置编码的限制以及在短标题上训练的不足,在处理超过 77 个 token 的描述时会遇到困难。HyFL-CLIP 通过在双曲空间中对 CLIP 进行微调来解决这个问题,该空间能更好地模拟全局上下文、组成部分和图像之间的层级关系和蕴含关系。这种方法能够实现更鲁棒的长上下文理解,并在跨模态检索任务中取得了显著的改进…
-
AI图像生成:保持多主体身份
这篇Reddit帖子讨论了在AI生成的图像中保持多个主体身份一致性的技术,特别是在使用单一参考图像时。用户正在寻求关于工作流程和方法的建议,以确保在各种姿势和场景中,个体角色都能保持可识别性。讨论涉及流行的图像生成模型和工具,如Stable Diffusion、DALL·E 3、Midjourney,以及相关的技术,如ControlNet、Lora和DreamBooth。
-
Stable Diffusion 用户寻求生成多样化、可信人脸的建议
一位 Reddit 用户正在寻求关于如何使用 Stable Diffusion XL(特别是在 ComfyUI 中)生成多样化且可信人脸的建议。他们的目标是创建一个 AI 影响者,但苦于无法摆脱典型的“AI 外观”,以实现更自然的“邻家女孩”美学。该用户已尝试使用 JuggernautXL、Flux2 4B Klein 和 Juggernaut Z 等模型,并尝试寻求 Claude 的帮助,但尚未找到批量生成不同面部特征的成功方法。
-
用户在快速发布中争论最佳开源图像模型
Reddit上的用户正在争论当前最佳的开源图像生成模型,对快速的发布周期和频繁的失望表示厌倦。讨论突出了Flux、Stable Diffusion XL微调模型、Qwen和Ideogram等模型,用户质疑哪些模型在基准测试之外真正适用于日常使用。
-
LTX 2.3 增强了 Stable Diffusion XL 的 Union Control 功能
LTX 2.3,Union Control 工具的新版本已发布,为 Stable Diffusion XL (SDXL) 提供了增强的功能。此次更新侧重于改进 SDXL 生态系统内的控制和集成。此次发布旨在为用户提供更精细的选项来管理和使用 SDXL 模型。
-
SDXL 完全在 iPhone 上运行,用户寻求移动端优化技巧
一位用户已成功在 iPhone 上完全运行了 Stable Diffusion XL (SDXL) 模型,在 A17 芯片上生成 768px 图像大约需要 20 秒。确定的主要瓶颈是 RAM,它将分辨率限制在 768x768,而不是 GPU 速度。用户正在寻求关于在移动设备上优化以减少步数和提高分辨率的建议,特别是询问关于少步蒸馏方法以及在不超出内存容量的情况下突破当前分辨率限制的技术。
-
用户脚本提升旧款 AMD GPU 上的 SDXL 性能
一位用户开发了一个脚本,使 Stable Diffusion XL (SDXL) 能够在具有 8GB 显存的旧款 AMD GPU 上更高效地运行。该脚本绕过了 Windows 上存在问题的 DirectML 后端,转而使用原生 ROCm/HIP 支持。此优化显著将每迭代的生成时间从 3.5 秒缩短到 1.6 秒,并将显存使用量减半,从而可以使用节省内存的 GGUF 模型。
-
用户寻求AI工具将草图转换为图像
一位Reddit用户正在寻求AI工具的推荐,这些工具可以将手绘草图转换为照片图像,同时保留原始构图。他熟悉Stable Diffusion XL和ControlNet等旧模型,但不知道最新的进展。由于没有强大的电脑,用户更喜欢可靠的在线服务。
-
新的CFG-OEC方法提高了扩散模型采样精度
研究人员推出了一种新方法CFG-OEC,通过解决结构性采样误差来改进扩散模型的条件采样。该误差源于训练期间的采样规则与目标之间的不匹配。CFG-OEC修改了分类器自由引导过程,以减少条件和无条件预测误差之间的相互作用,从而提高图像生成质量。
-
新研究推动生成模型在效率和评估方面取得进展
几篇最新的研究论文探讨了生成模型的进展,重点是提高其效率、可评估性和对齐性。其中一篇论文提出了一种使用基于分数的生成模型进行加权采样的新框架,实现了显著的加速。另一个理论框架解决了生成模型的统计可评估性问题,区分了可以从有限样本中可靠估计的指标和不能的指标。其他研究介绍了参数高效的生成建模方法、将模型校准到分布约束以及使用基于样本的变分推理来对齐少样本生成模型的方法。
-
Stable Diffusion 用户寻求高级服装迁移技术
一位 Reddit 用户正在寻求使用 Stable Diffusion XL 在 AI 生成的图像中精确控制服装的方法。他们正在寻找将服装在图像之间迁移或在主体上更换服装的方法,但目前设置的结果不佳。用户受到硬件限制,特别是 12GB 的显存,并想知道这是否是 SDXL 的根本限制。