PulseAugur
中
实时 07:40:40
实体 Stable Diffusion 3

Stable Diffusion 3

PulseAugur coverage of Stable Diffusion 3 — every cluster mentioning Stable Diffusion 3 across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
25
90 天内 25
发布 · 30天
0
90 天内 0
论文 · 30天
19
90 天内 19
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 28 条
  1. TOOL · CL_280539 ·

    新的诊断工具揭示扩散模型中的控制-修复分离

    研究人员开发了一种新的方法来诊断和控制文本到图像扩散模型中的失败,特别是在组合任务中。他们引入了一个仅文本的组合压力指数(CSI)来识别 SD1.5、SDXL 和 Stable Diffusion 3 等模型中常见与罕见的组合。他们的研究发现,虽然组合缺陷可以在去噪过程之前诊断出来,但揭示这些风险的具体坐标并不总是能改善生成的坐标,这表明诊断和控制之间存在分离。

  2. COMMENTARY · CL_255369 ·

    AI的“开放权重”与“开源”之争仍在继续 · 已追踪2个来源

    在AI领域,“开放权重”与“开源”之间的区别是一个持续争论的主题,许多模型在发布时提供了可访问的权重,但并未完全开源代码或训练数据。虽然下载模型变得越来越简单,但从根本上理解它们的创建过程和修改它们仍然具有挑战性。“开源AI定义”的批评者尚未提出一个被广泛接受的替代方案,而当前的AI政策似乎更侧重于单个模型组件及其许可证,而不是更广泛的定义。

  3. TOOL · CL_247883 ·

    新框架可准确归因合成图像,区分 Stable Diffusion 版本

    研究人员开发了一种新颖的合成图像归因框架,在挑战性数据集上实现了高精度。他们的方法结合了多种人工智能架构,包括 FFT-ConvNeXt、DINOv2、CLIP 和 Xception,从频率、语义和取证等不同角度分析图像。为了提高对图像操纵的鲁棒性,他们采用了模拟真实世界后处理的广泛数据增强。该框架通过采用专用的二元分类器和类自适应置信度校准,专门解决了 Stable Diffusion 3 和 Stable Diffusion 3.…

  4. TOOL · CL_239590 ·

    ImageNet 增强技术可媲美用于文本到图像生成的大规模数据集

    研究人员证明,仅使用 ImageNet 数据集,通过文本和图像增强,文本到图像生成模型就能达到高性能。这种方法挑战了依赖于大规模、网络抓取数据集的普遍的“越大越好”的范式。所提出的方法在 GenEval 和 DPGBench 等基准测试中,显著优于 FLUX 和 SD3 等模型,同时仅使用了训练数据和参数的一小部分。

  5. TOOL · CL_224340 ·

    微控制器上运行的微型 AI 图像生成器

    一位开发者成功地在 RP2350 微控制器上实现了一个微型图像生成模型,该模型能够生成 128x128 像素的人脸图像。这个模型是一个潜在流 Transformer,拥有约 240 万至 400 万个参数,量化为 INT8,推理时间约为 20 秒。该实现包括条件生成和无配置引导等功能,展示了在资源受限硬件上的高级 AI 能力。

  6. RESEARCH · CL_206625 ·

    Nexus模型提供与SDXL相当的高效文本到图像生成

    研究人员推出了一种新颖的文本到图像生成模型Nexus,旨在提高效率。Nexus集成了稀疏架构、线性复杂度和低比特量化,结合了MoE前馈层和门控DeltaNet注意力。这种方法使Nexus在生成质量上可与SDXL和Stable Diffusion 3等成熟模型相媲美,同时显著提高了推理速度并降低了内存需求。在COCO和Laion数据集上进行的实验验证了其有效性。

  7. RESEARCH · CL_203962 ·

    新研究为文本到图像 AI 提供高级控制和安全性

    两篇新研究论文提出了增强文本到图像生成模型控制和安全性的新颖方法。第一种方法 DiSCO,通过对比评分优化提示,提供了一种黑盒防御来防止生成不安全内容(NSFW),在保持图像质量的同时显著减少了有害输出。第二种方法 Concept Guidance (CoG) 是一种无需训练的方法,通过强化扩散模型中与概念相关的层来精确控制图像生成,在不改变模型本身的情况下提高了美学吸引力和局部连贯性。

  8. TOOL · CL_193658 ·

    新的SNR-Edit框架增强了无反演图像编辑

    研究人员开发了SNR-Edit,一种使用流 기반生成模型进行无反演图像编辑的新框架。该方法通过采用结构感知噪声校正,将分割约束注入初始噪声,从而解决了现有方法的局限性。该技术将源轨迹锚定到真实图像的隐式反演位置,减少了漂移并保持了结构完整性,而无需调整模型。在PIE-Bench和SNR-Bench等基准上的评估表明,SNR-Edit具有最小的开销,效果显著。

  9. TOOL · CL_180411 ·

    新的c-rectified flow框架为图像生成提供最优传输

    一篇新论文介绍了一种名为“c-rectified flow”的成本感知框架,用于大规模图像生成,并提供了计算和统计保证。该方法旨在改进FLUX和Stable Diffusion 3等系统中使用的现有rectified flow技术,在特定假设下确保收敛到最优传输耦合。研究还建立了定量的收敛速率,并证明了最优传输的近乎参数的估计速率。

  10. RESEARCH · CL_167816 ·

    新的缓存方法加速扩散模型推理,延迟最多可降低 6.7 倍

    研究人员开发了新的方法,通过智能缓存和重用中间特征来加速扩散模型推理。OnlineCache 学习动态缓存策略和误差校正,以根据提示的复杂性和时间步的误差敏感性来调整资源分配,速度最多可提升 3 倍。FeatFix 专注于局部精确特征校正,重用已验证的特征来重置残差并减少下游误差,速度最多可提升 6.7 倍。OmniCache 采用多维分层缓存框架,利用帧内、帧间和去噪步骤冗余等各种冗余源来减少延迟,最多可降低 35%,同时不影响质量。

  11. TOOL · CL_129408 ·

    新的 FairFlow 框架解决了文本到图像 AI 中的刻板印象偏见

    研究人员开发了 FairFlow,一个旨在解决文本到图像扩散模型(特别是多模态扩散 Transformer (MM-DiTs))中刻板印象偏见的新框架。该研究确定了这些模型中充当“语义中心”并从文本提示传播偏见到视觉输出的特定层。FairFlow 在推理过程中干预这些确定的中心,注入学习到的“公平方向”来中和与性别、种族和交叉性相关的偏见,而不会显著影响生成质量或推理速度。

  12. TOOL · CL_118123 ·

    UltraImageGen框架实现高效超高分辨率图像生成

    研究人员开发了UltraImageGen,一个旨在克服当前文本到图像扩散模型在生成超高分辨率图像方面局限性的新框架。通过采用具有低分辨率全局引导的分层局部注意力机制,该系统将高分辨率潜在变量划分为更小的窗口,将计算复杂度从二次方降低到接近线性。这种方法结合轻量级LoRA适配以实现语义一致性,能够以超过8K的分辨率合成图像,与FLUX和SD3等现有模型相比,速度显著加快,内存使用量也大大减少。

  13. TOOL · CL_117958 ·

    Momentum Guidance 提升流模型图像生成质量

    研究人员推出了一种名为 Momentum Guidance (MG) 的新技术,旨在提升流模型生成的图像质量。MG 通过在 ODE 轨迹上推断当前速度来工作,在保持每步标准计算成本(一次评估)的同时提高了样本质量。该方法在 ImageNet-256 等基准测试中,在 Fréchet inception distance (FID) 等指标上取得了显著改进,并证明了其在应用于 Stable Diffusion 3 和 FLUX.1-de…

  14. SIGNIFICANT · CL_113064 ·

    阿里巴巴发布开源视频生成套件 Wan 2.1

    阿里巴巴的 Wan 团队发布了 Wan 2.1,这是一个开源视频生成模型套件,旨在让高质量视频生成更加易于获取。该套件包括文本到视频、图像到视频和视频编辑功能,其参数大小针对高端和消费级 GPU 进行了优化。Wan 2.1 采用了一种 Diffusion Transformer 架构,并配备了一种新颖的视频变分自编码器,该编码器可保持时间因果关系以减少闪烁伪影,并支持中文和英文文本提示。

  15. TOOL · CL_111804 ·

    新方法可在无需重新训练的情况下实现文本和图像到图像生成

    研究人员开发了TF-TI2I,一种新颖的文本和图像到图像生成方法,可以在无需进一步训练的情况下适配现有的文本到图像模型。该方法利用MM-DiT架构,使文本标记能够从视觉标记中隐式学习视觉信息。关键技术包括用于选择性信息共享的参考上下文掩码(Reference Contextual Masking)和用于缓解分布偏移的赢者通吃模块(Winner-Takes-All module)。该团队还引入了FG-TI2I Bench,一个旨在评估文…

  16. RESEARCH · CL_93061 ·

    CustomShift通过Stable Diffusion 3增强图像定制

    研究人员推出了一种新颖的双分支架构CustomShift,用于文本到图像生成中的主体驱动图像定制。该方法基于Stable Diffusion 3,通过将定制表述为条件注意力分布迁移来解决现有方法的局限性。CustomShift旨在通过对齐参考图像特征与潜在表示,并整合文本和参考线索,来同时提高语义保真度和主体一致性。

  17. TOOL · CL_86344 ·

    ComfyUI-PiD 更新增加了原生模型支持和 FP8 精度

    ComfyUI 的一个自定义节点 ComfyUI-PiD 已更新,支持原生 PixelDiT/PiD 模型加载和 FP8 精度。此次更新消除了对旧加载方法的依赖,并与 ComfyUI 的原生模型文件夹集成。新功能包括一个仅图像的平铺放大器节点,以及对 SD3、SDXL 和 Qwen-Image 等各种骨干网络的支持,并附带即用型示例工作流。

  18. TOOL · CL_82757 ·

    新方法解决文本到图像模型中的提示遗忘问题

    研究人员在用于文本到图像生成的多模态扩散 Transformer (MMDiTs) 中发现了一个“提示遗忘”问题。这种现象发生是因为文本提示的语义表示在穿过模型更深层时会降级。为了解决这个问题,提出了一种名为“提示再注入”的新型无训练方法,该方法将早期层的提示表示重新引入到后期层。在 SD3、SD3.5 和 FLUX.1 等模型上进行的实验表明,该技术提高了指令遵循能力和整体生成质量。

  19. TOOL · CL_74161 ·

    ComfyUI 将完整图像生成管线集成到单一“Image Oasis”节点中

    ComfyUI 发布了一个名为 Image Oasis 的全新一体化节点,将 50 多个独立节点整合到一个单一、用户友好的界面中。该节点简化了从模型加载、架构切换到 LoRA 堆叠和放大处理的整个图像生成管线。它还具有一个由本地 GGUF LLM 驱动的可选集成提示增强器,为 ComfyUI 中的图像创建提供了全面的解决方案。

  20. FRONTIER RELEASE · CL_69128 ·

    Ideogram发布开源Ideogram 4模型,支持2K分辨率

    Ideogram发布了Ideogram 4,一个在设计导向任务和文本渲染方面表现出色的开源文本到图像模型。该模型提供原生2K分辨率以及边界框控制和结构化JSON提示等高级功能。在Design Arena和ContraLabs等基准测试中,它在开源模型中表现最佳,使其成为专有系统的有力竞争者。