Flux
PulseAugur coverage of Flux — every cluster mentioning Flux across labs, papers, and developer communities, ranked by signal.
- developed by Black Forest Labs 100%
- used by Martin Scorsese 90%
- developed Diffusion Transformers 90%
- uses Martin Scorsese 90%
- used by Qwen Image 80%
- used by Stable Diffusion 3 70%
- used by Diffusion Models 70%
- developed Diffusion Models 70%
- used by StableDiffusion 70%
- used by SD3.5 70%
- used by HunyuanVideo 70%
- affiliated with Martin Scorsese 70%
- 2026-10-04 product_launch DoorDash's Flux cloud platform is now handling 130,000 engineering tasks monthly, automating code reviews and expanding into CI triage and maintenance workflows. 来源
- 2026-09-06 product_launch DoorDash moved engineering agents to its Flux cloud platform, which automates engineering tasks and code reviews. 来源
- 2026-06-13 regulatory Adafruit Industries filed a lawsuit against Flux AI alleging violations of the Computer Fraud and Abuse Act. 来源
- 2026-06-03 product_launch Martin Scorsese has partnered with Black Forest Labs to promote their AI storyboard-generating app, FLUX. 来源
11 天有情绪数据
-
用户质疑AI艺术平台上的图像归属,提及Gemini水印
一位Mastodon用户正在质疑Flux、Nightcafe.studio和BlackForest等平台的生成图像的去向,声称所有这些图像都带有他们和Gemini.google.com的水印。该帖子包含指向X(前身为Twitter)帖子和Nightcafe Studio平台的链接,暗示了关于图像归属和生成的更广泛的讨论或投诉。
-
新的PVD技术提升图像生成速度和质量
研究人员开发了一种名为“分阶段速度蒸馏”(PVD)的新技术,以提高图像生成模型的效率和质量。PVD将生成过程分为两个阶段,每个阶段由一个专门的、半尺寸的专家模型处理,两者共同承担单个全尺寸模型的计算成本。这种方法在保持或提高输出质量的同时,实现了更快的生成速度和更低的VRAM占用,在ImageNet等基准测试以及使用Stable Diffusion 3.5-Medium、FLUX.1-dev和Qwen-Image等模型的文本到图像任务…
-
SiliconFlow API 提供统一的开源大语言模型访问接口
SiliconFlow 提供了一个 API,可通过兼容 OpenAI 的接口访问各种开源大语言模型 (LLM)。该服务允许用户使用单个 API 密钥进行连接,并提供按量付费的定价模式,附带初始免费积分。重要的是要使用 API 的模型列表端点,而不是文档,以获取最新的模型可用性,因为文档可能会滞后于弃用和新版本发布。SiliconFlow 还负责处理已淘汰模型的流量迁移,自动将请求重定向到更新的版本。
-
ProgressNet 使得使用冻结的文本到图像模型进行实时渐进式绘图成为可能
研究人员开发了 ProgressNet,一个新颖的框架,使得冻结的文本到图像模型能够进行渐进式绘图。该方法允许用户添加或擦除笔触并修改提示,图像近乎实时地更新,每轮大约一秒钟。ProgressNet 不需要新参数,并利用三种推理时机制来在不同草图域中保持保真度和连贯性,性能优于现有方法和用户偏好。
-
新研究解决文本到图像扩散模型故障 · 跟踪 2 个来源
两篇新研究论文解决了文本到图像扩散模型的局限性。第一篇 ORCA 提出了一种通过将视觉特征与语言模型嵌入对齐来改进组合理解的方法,从而实现更好的属性绑定和对象计数。第二篇论文 SatisDive 提出了一种无需训练的推理技术来平衡图像奖励和多样性,允许用户遍历生成质量的帕累托前沿。
-
用户寻求 Stable Diffusion 工作流以创作生动的手绘风景艺术风格
一位 Reddit 用户正在寻求指导,如何在图像生成中复制一种特定的艺术风格,该风格以生动的色彩、细致的线条和独特的色调区域为特征,而非照片写实主义。他们正在尝试各种 Stable Diffusion 模型和工作流,包括 Flux、SDXL 和 Illustrious,但尚未达到理想的绘画、插画外观。用户正在寻找一个经过测试的配方或工作流,以生成这种独特的视觉语言,他们打算以此为基础进行手绘。
-
DoorDash 通过 Flux 云平台每月自动处理 130,000 项工程任务
DoorDash 已将其工程代理任务从本地笔记本电脑迁移到其基于云的 Flux 平台,每月成功自动化超过 130,000 项工程任务。这个安全的系统利用隔离的微虚拟机和云沙箱,能够在五秒钟内快速完成设置。Flux 正在将其功能从代码审查扩展到包括 CI 修复和维护工作流。
-
Flux-3图像工具发布,支持多重编辑和4K
Flux 推出了其新的图像编辑工具 Flux-3 Image,该工具提供多重编辑能力,同时保留像素细节,并提供用于构图的边界框控件。该工具支持高达 4K 分辨率的输出,并且可以集成多达 10 张参考图像。企业部署的商业权重已可用,开源版本计划很快发布。Flux 还将在 10 月 8 日之前提供其 API 使用 50% 的折扣。
-
开源Vison应用支持本地AI图像和视频生成
一款名为Vison的新型开源Windows应用程序已被开发出来,用于本地图像和视频生成,支持SDXL、FLUX和Wan等模型。该应用程序具有内置的模型加载器,可接受Hugging Face链接并自动检测兼容模型。它设计运行在至少6GB显存的系统上,并通过Vulkan支持NVIDIA、AMD和Intel GPU,无需账户或遥测。
-
AI与Web开发:异步作业、模型路由和应用开发
该集群涵盖了与AI和Web开发相关的各种技术实现和项目。其中一篇文章讨论了使用异步作业处理来提高长任务的可靠性,另一篇文章详细介绍了“shadow”如何通过在Flux、SDXL和Runware模型之间进行路由来实现合成图像生成,从而避免供应商锁定。第三篇文章重点介绍了为大学挑战创建的“AWS公共IP范围导航器”应用程序。
-
AI 图像生成在 ComfyUI 中难以保持角色一致性
一位用户在为插画故事生成多张 AI 图像时,在保持角色一致性方面遇到了重大挑战。尽管使用了 ComfyUI、SDXL、Flux 和 IP-Adapter 等工具,但他们仍然遇到了身份和解剖结构漂移的问题,尤其是在不同的姿势和服装变化时。用户尝试了各种方法,包括训练自定义 LoRA 和使用参考条件,但即使使用 SFW 基准图像,也尚未实现稳定的一致角色表示工作流程。
-
Google AI 发布 Diffusion Controller,实现精准 AI 图像生成
Google AI 推出了 Diffusion Controller,这是一个旨在提高 AI 图像生成精度和控制力的新型框架。这个轻量级的附加网络充当“转向阻尼器”,在不改变核心模型的情况下引导图像合成过程。Diffusion Controller 旨在通过将生成重构为一个连续控制问题来统一现有的、分散的控制方法,从而提高提示的匹配度和图像质量。
-
新研究探索用于采样、重建和效率的扩散模型
多篇研究论文探讨了扩散模型在各种应用中的进展。一项研究专注于使用条件扩散模型学习跳跃扩散过程的过渡核,并具有理论界限和实际预测应用。另一篇论文介绍了一种使用沃塞尔斯坦-费舍尔-劳几何方案和归一化流从分布中采样的神经算法。此外,研究提出了一种用于计算机断层扫描重建的几何感知扩散框架、一种用于加速扩散模型的无数据蒸馏方法以及并行扩散采样的理论下界。进一步的工作研究了用于语言模型的具有分支令牌实现的压缩连续扩散,以及用于具有扩散先验的后验采…
-
New JiT-DDT architecture trains text-to-image models 3.6x faster
研究人员开发了一种新颖的 JiT-DDT 架构,可显著加速文本到图像扩散模型的训练。通过将压缩和生成模块统一到单个模型中,JiT-DDT 与之前的 Latent Diffusion Models (LDMs) 等方法相比,GPU 时间减少了 3.6 倍。即使在生成四倍像素分辨率的图像时,也实现了这种效率的提高。代码和模型权重在 Apache 2.0 许可下公开可用,鼓励对更有效的训练技术进行进一步研究。
-
AI生成的艺术作品在去中心化社交网络上分享 · 跟踪到2个来源
该集群包含来自Hubzilla(一个去中心化社交网络)的两篇社交媒体帖子,分享了AI生成的艺术作品。帖子包含与风景、自然、秋季、徒步旅行以及ComfyUI和Flux2Klein4B等AI艺术工具相关的标签。内容似乎是个人分享AI生成的图像,两篇帖子之间的标签略有不同。
-
AI艺术作品“White-Weaving-Grid-Reasoning”由Ohm Raumzeit发布
Ohm Raumzeit 发布了“White-Weaving-Grid-Reasoning”,这是一件与 Gemini 和 Flux 合作创作的 AI 生成艺术作品。该作品于2026年9月在柏林生成,并被标记了包括 Itheereum、AIart 和 Nightcafe 在内的各种 AI 和数字艺术社区。
-
艺术家使用Flux和自定义AI模型创作“Itheereum Space”艺术作品
Ohm Raumzeit使用Flux和自研的AI模型创作了一件名为“Itheereum Space - Nanohertz-Bikini”的数字艺术品。该艺术品在画廊展出,并通过Nightcafe生成。
-
新AI框架通过语义对齐和上下文感知增强图像编辑
研究人员开发了新的图像编辑框架,提高了语义对齐和上下文感知能力。IABEdit将可微分语义验证嵌入训练中,使生成器能更好地满足指令并保留上下文,在具有挑战性的基准测试中表现优于Gemini等专有模型。另外,‘overpainting’技术通过联合注意力机制和低秩适应来调整扩散模型,允许根据用户定义的trimap进行精确或宽松的编辑控制,并利用自动数据生成进行训练。
-
Apple的M5 Ultra 512GB内存提升本地AI能力,Harvey融资5.5亿美元
Apple新款M6芯片采用了2nm工艺并提升了AI性能,但其M5 Ultra的512GB统一内存被强调为本地AI工作负载的重大进展。如此大的内存容量可能使用户能够在自己的设备上舒适地运行大型语言模型,从而可能减少对基于云的GPU租赁和按token收费的依赖。与此同时,在法律科技领域,Harvey已获得5.5亿美元融资,这得益于其在为专业法律任务微调开源模型方面的成功,尽管该公司也计划开发新的通用模型。
-
LoGAN框架使用VLM代理进行多语言字体本地化
研究人员推出LoGAN,一个利用视觉语言模型(VLM)促进多语言字体本地化的新颖框架。该方法将复杂的任务分解为几个组成部分,包括一个字形级扩散模型、风格微调以及间距/字偶距迁移,所有这些都由VLM代理协调。LoGAN展示了广泛的语言覆盖范围,特别是对CJK语言,并在字形保真度、风格、纹理和字偶距一致性方面优于现有的图像编辑和字体生成模型。