FLUX.2
PulseAugur coverage of FLUX.2 — every cluster mentioning FLUX.2 across labs, papers, and developer communities, ranked by signal.
- used by Qwen Image 90%
- used by Flux 90%
- instance of Flux 3 90%
- developed by Flux 90%
- instance of Z Image 70%
- used by Diffusion Transformers 70%
- used by Stable Diffusion 3 70%
- competes with Ideogram 4 70%
- used by provod.ai 70%
- competes with Z Image 60%
- affiliated with Qwen Image 50%
- affiliated with Flux 50%
- 2026-05-22 product_launch Black Forest Labs launched the FLUX.2 image generation model. 来源
9 天有情绪数据
-
开源图像模型 FLUX.2 在人类偏好测试中接近顶级性能
FLUX.2,一个开源图像编辑模型,已获得高排名,紧随 Reve 2.1 之后。这一排名是通过盲测人类偏好评估确定的,突显了其在不依赖营销宣传下的性能。该模型可供下载,表明其在开源社区内的可访问性。
-
研究质疑潜在扩散模型中引导方法的有效性
一篇新的研究论文重新审视了潜在扩散模型中的无分类器引导(CFG)方法,在两个开源的修正流变换器上评估了八种无需训练的技术。研究发现,没有一种单一方法能在所有测量标准上持续提高图像质量,包括构图一致性和与文本提示的语义对应性。虽然APG取得了一些最高分,但提升幅度通常在评估不确定性范围内,而注意力扰动方法在不同模型上的结果好坏参半。
-
Gemini 3 Pro Image 在文本到图像基准测试中领先,击败 FLUX.2
一篇新论文在具有挑战性的图像描述提示上对四种领先的文本到图像模型——Hunyuan 3.0、Gemini 3 Pro Image、Black Forest Labs FLUX.2 和 Ideogram 3.0——进行了基准测试。使用来自 Sample Dataset (DSD) 的 48 个复杂提示进行的评估显示,Gemini 3 Pro Image 以 84.8/100 的得分成为最佳表现者,紧随其后的是 FLUX.2,得分为 82…
-
开源 FLUX.2 图像模型在人类偏好测试中落后于 Reve 2.1
开源图像编辑模型 FLUX.2 已与 Reve 2.1 进行了评估。在两次独立的评估中,FLUX.2 比 Reve 2.1 落后 58 和 59 ELO 分,表明存在轻微的性能差距。这些排名基于人类盲测偏好,而非市场宣传,表明关注点在于客观用户体验。
-
Black Forest Labs 发布 FLUX 3 多模态基础模型
Black Forest Labs 发布了 FLUX 3,这是一款新的多模态基础模型,在训练过程中集成了图像、音频和视频数据。这种方法旨在创造对现实更全面的理解,使模型能够生成更好地反映物理定律和时间动态的输出。该模型能够根据简单的文本提示生成高质量的视频,展示了在无需过于描述性输入的情况下处理复杂场景和美学细节的能力。
-
Black Forest Labs的FLUX模型:免费版与付费版,以及图像版与多模态版
Black Forest Labs的FLUX模型呈现出复杂的许可和定价结构,导致寻求免费图像生成的用户感到困惑。只有FLUX.1 [schnell]版本,根据Apache 2.0许可协议可用,才真正可供商业免费使用。其他版本,包括FLUX.1 [dev]和FLUX.2,在商业应用中需要付费许可。新发布的FLUX 3是一个专注于视频和机器人技术的多模态模型,其图像生成能力仍处于早期访问阶段,尚未能取代FLUX.2用于标准图像任务。
-
NuclearDiffusion 模型增强了核能概念的 AI 图像生成能力
研究人员开发了 NuclearDiffusion,这是一个通过微调开源扩散模型而专门用于核能概念的文本到图像模型。研究发现,微调显著提高了 Stable Diffusion XL (SDXL) 的性能,但对 SD-v3.5-Medium 的影响有限,对 Flux.1 没有任何可衡量的效果,这表明适应效果与生成架构有关,而不仅仅是模型规模。与 GPT-Image-2 和 Midjourney 等商业系统相比,微调后的开源模型为专业的核工…
-
新的KVAE分词器旨在推进多模态生成模型
研究人员推出了一系列名为KVAE的新型分词器,专为多模态生成模型设计。这些分词器,包括KVAE-Audio、KVAE-3D和KVAE-2D,专门为跨音频、视频和图像数据的文本条件生成任务而构建。该论文详细介绍了这些模型的开发、训练和消融研究,并与社区分享了代码和训练细节。评估表明,KVAE分词器在各种重建和生成指标上均达到或超过了现有开源替代品的性能。
-
Flux.2 ComfyUI 图集成多种 AI 功能,引发工作流复杂性争论
一个名为 Flux 的社区开发的 ComfyUI 图已为 FLUX.2 模型创建,集成了文本到图像、图像到图像、分割和参考控制等多种功能。作者质疑这个一体化图是否是一个方便的工作流,还是一个复杂、难以管理的节点“意大利面”。这种通用图的实用性取决于其在典型用户输入和依赖项下的可预测性能,而不仅仅是其功能列表。文章建议,对于复杂任务,将工作流分解为更小、更专业化的图可能比单个大型图更易于管理,特别是如果需要手动调整或依赖项查找。
-
FLUX.2 [max] 挑战顶级 AI 图像模型,与 OpenAI 差距甚微
FLUX.2 [max] 被誉为顶级开源图像生成模型,其性能与领先的专有模型相比表现强劲。虽然在生成任务上比 OpenAI 的 GPT Image 2 落后 143 ELO 分,但其总体仅比 OpenAI 的顶级模型落后 56 ELO 分。在图像编辑方面,FLUX.2 [max] 比 Sourceful 的 Riverflow 2.0 落后 82 ELO 分。
-
AI API提供商在集成前必须披露法律身份
文章讨论了在集成AI API提供商的服务之前,核实其法律和运营身份的重要性。文章以“Yes AI”(yesai.su)为例,该公司提供ChatGPT和Stable Diffusion等各种模型的API,但缺乏公开的公司信息,例如法律实体名称、注册号或地址。作者强调,工程师应向支持部门提交正式的书面询问,以建立可验证的提供商身份和条款记录,而不是基于假设发放API密钥。
-
新的 ControlNet 方法将姿态和深度集成到 FLUX.2 模型中
一种新的方法已被开发出来,用于将姿态和深度控制集成到 FLUX.2 系列图像生成模型中。该方法利用现有的姿态、深度或边缘映射 ControlNet 模型,然后将这些模型作为参考图像输入到 FLUX.2 中。与传统方法不同,该技术不需要 FLUX.2 变体使用加载器链或额外的权重,从而使结构控制在整个系列中变得免费且一致。
-
新的VETO防御可保护图像免受高级AI编辑
研究人员开发了VETO,一种新的方法来保护图像免受FLUX.2等高级AI模型的编辑。与针对旧版编辑流程的先前防御措施不同,VETO专门破坏了现代模型用于提取和重新语境化图像信息的联合注意力机制。为了评估其有效性,还引入了一个名为VetoBench的新基准,该基准测试了防御措施对局部编辑和更广泛的上下文变化的能力。VETO在多个当代编辑模型和基准测试中展示了卓越的性能和更好的保护-保真度权衡。
-
俄罗斯用户通过聚合器访问FLUX.1图像模型,面临支付限制
来自Black Forest Labs的图像生成模型FLUX.1 [dev],常被搜索为“flux 1d”,俄罗斯用户可以通过各种聚合器和直接API平台访问,尽管开发者网站上的直接支付仅限于外国卡。俄罗斯用户可以通过provod.ai等平台访问该模型,这些平台提供官方提供商费率。FLUX.1 [dev]是更大模型家族的一部分,包括在Apache 2.0许可下的FLUX.1 [schnell]以及用于编辑的FLUX.1 Kontext,…
-
Blue Funnel Line 发布 FLUX 3 多模态模型,赋能机器人控制
Blue Funnel Line 推出了 FLUX 3,一款集成了图像、视频和音频生成能力的新型多模态基础模型。该模型与 mimic robotics 合作进一步开发,创造了 FLUX-mimic,一个能够控制机器人的视频动作模型。FLUX-mimic 已被 Audi 测试并部署,展示了该模型理解和与物理世界交互的能力,将其能力从内容创作扩展到物理人工智能应用。
-
FLUX.2、Wan 2.7 和 Qwen Image 2 等 AI 图像模型在 Civitai 上获得关注
“flux b15”一词是误称,因为它指的是一个 Minecraft 作弊客户端,而不是一个 AI 模型。然而,搜索该词的用户在 Civitai 上发现了一些真实的图像生成模型。其中包括 Black Forest Labs 的 FLUX.2,它在照片级真实感和参考处理方面表现出色,以及 2026 年 4 月的新增模型:Grok Imagine (xAI)、GPT Images 2.0 (OpenAI)、Ernie Image (Bai…
-
Oxygen-TryOn:新型时尚原生模型在虚拟试穿方面表现出色
研究人员推出了 Oxygen-TryOn,这是一款专为各种时尚类别中的虚拟试穿应用设计的新型基础模型。与通用图像编辑器不同,Oxygen-TryOn 利用专用的数据引擎和专门的训练,实现人物穿着各种商品的逼真合成。该模型支持多张参考图像、全身或半身视图以及自由的多商品组合,同时保持人物身份和商品外观。在单商品和多商品虚拟试穿的基准测试中,其性能优于现有的专有和开源系统。
-
新的摊销矩匹配技术增强视觉生成模型
研究人员引入了摊销矩匹配(AMM),一种使用神经网络从数据矩学习分布训练信号的新技术。该方法实例化为摊销弗雷歇距离(AMFD)损失,提供了比精确统计匹配更鲁棒的训练动态,并显著提高了在ImageNet和FDr$^6$等基准测试上的性能。AMM在文本到图像生成方面也显示出潜力,增强了指令遵循能力,并在GenEval基准测试上超越了多步教师模型。
-
Microsoft 发布 Mage-Flow,一款紧凑型 4B 图像生成模型
Microsoft 发布了 Mage-Flow,这是一款紧凑型 4B 规模的生成模型,专为高效的文本到图像生成和基于指令的图像编辑而设计。该模型通过协同设计的标记器 (Mage-VAE) 和多模态扩散 Transformer (NR-MMDiT) 实现了具有竞争力的质量,能够生成高达 2048 像素的原生分辨率图像。Mage-Flow 及其编辑变体 Mage-Flow-Edit 有基础版、RL 对齐版和 Turbo 版,与更大的模型相…
-
新的VLM篡改检测框架取得最先进成果
研究人员开发了一个新的框架,用于检测现代视觉语言模型(VLMs)中的像素级图像篡改。该方法侧重于域泛化,以确保在不同的VLM生成操纵分布中具有鲁棒性。它采用平衡的小批量采样方案来防止有偏优化,以及一种后期注入策略,在初始训练后将检测器暴露于新数据。该方法在各种分布外VLM上的检测精度方面显著优于先前最先进的技术,显示出实质性的相对改进。