Flux
PulseAugur coverage of Flux — every cluster mentioning Flux across labs, papers, and developer communities, ranked by signal.
- developed by Black Forest Labs 100%
- used by Martin Scorsese 90%
- developed Diffusion Transformers 90%
- uses Martin Scorsese 90%
- used by Qwen Image 80%
- used by StableDiffusion 70%
- used by Stable Diffusion 3 70%
- used by SD3.5 70%
- used by Diffusion Models 70%
- used by Diffusion Transformers 70%
- affiliated with Martin Scorsese 70%
- competes with Z Image 70%
22 天有情绪数据
-
Stable Diffusion 用户寻求 Flux/Krea 工作流以实现一致的角色 img2img
一位 Reddit 用户正在寻找使用 Stable Diffusion 中的 Flux 和 Krea 的特定图像到图像工作流。目标是在将主体置于新场景和环境的同时,保持角色的连贯性。用户强调需要精确复制角色,而非仅仅相似。
-
ROCm 7.10 更新解决了特定 AMD GPU 的稳定性问题
建议使用特定 AMD GPU 架构(gfx1100、gfx950、gfx1151)的用户升级到 ROCm 7.10。此更新解决了动态显存卸载到内存时未产生 NaN 错误等问题,并允许在单一环境中统一使用 Qwen、Flux、Krea 和 Minimax 等各种模型。虽然更新未提供速度提升,但增强了这些 GPU 设置的稳定性和兼容性。
-
AI 本地生成王者基多拉新闻广播
一位用户使用 MiniMax H3 和 ComfyUI 中的 FLUX 关键帧在本地设置中创建了一个包含王者基多拉的2分钟新闻广播。整个制作过程,包括所有声音和音效,均由 AI 模型生成。用户详细介绍了他们的过程,并强调了模型在长时间静默时出现胡言乱语以及主体比例和生物设计在不同镜头之间不一致等挑战。
-
新的AViTS框架提高了Diffusion Transformer在图像生成方面的效率
研究人员开发了AViTS,一个旨在提高用于图像生成的Diffusion Transformers (DiTs) 效率的新框架。该方法自适应地选择时空令牌,优先处理分辨率细化所需的关键令牌,而推迟处理不太重要的令牌。AViTS旨在减少冗余计算,并提高DiTs动态分辨率采样中的质量-效率权衡。该框架已在FLUX上实现了高达6.34倍的FLOPs减少,在Qwen Image Edit和FLUX.1-Kontext-dev上实现了近9倍的FL…
-
LocalAI 提供开源 OpenAI API 替代品,支持自托管生成式 AI
LocalAI 是一个开源项目,提供 OpenAI API 的自托管替代方案,允许用户在自己的硬件上运行各种大型语言模型和其他生成式 AI 工具。它提供即插即用式替代功能,使开发人员能够通过最少的代码更改从 OpenAI API 切换到本地实例。该工具支持 Llama、Mistral 和 Qwen 等多种模型,并超越了文本生成,还包括图像生成、音频转录和文本到语音功能。
-
新方法通过新颖的特征缓存策略加速扩散模型 · 已追踪2个来源
两篇新的研究论文提出了加速扩散模型的新颖方法,扩散模型在图像和视频生成方面计算量很大。第一篇论文《重新思考逐令牌特征缓存》(Rethinking Token-wise Feature Caching)介绍了DuCa,一种双重特征缓存策略,通过随机令牌选择迭代地应用激进和保守的缓存,挑战了“重要”令牌总是需要计算的观念。第二篇论文《LinCa: 通过可学习分解特征缓存加速扩散模型》(LinCa: Accelerating Diffusi…
-
像 Stable Diffusion 这样的 AI 图像模型现在通过 TypeScript 在浏览器中运行
ONNX Runtime Web 和 WebGPU 的最新进展使得像 Stable Diffusion 和 Flux 这样的复杂 AI 模型能够直接在浏览器中使用 TypeScript 运行。这一转变将 AI 模型执行从专用的后端基础设施转移到客户端或边缘设备,显著改变了全栈工程实践。文章详细介绍了潜在扩散模型(LDMs)和校正流匹配(Rectified Flow Matching)的机制,解释了它们如何在压缩的潜在空间中运行,并利用…
-
Unsloth 通过新 UI 简化本地 AI 模型训练
Unsloth 是一个在 GitHub 上获得关注的项目,它发布了一个本地用户界面,简化了大型语言模型和扩散模型的训练与部署。该工具允许用户在消费级 GPU 上微调和运行各种开源模型,包括 Qwen3.8、Kimi K3 和 Gemma 4。通过抽象复杂的命令行操作,Unsloth 使高级 AI 开发对个人用户以及重视数据隐私或成本节省的用户更加易于访问。
-
RankT2I框架自动化文本到图像编辑的语义发现
研究人员开发了RankT2I,一个旨在自动识别文本到图像模型中可编辑语义的新颖框架。这种无需训练且模型无关的方法解决了手动指定图像生成和编辑修改的挑战,而这通常非常耗时。RankT2I利用多模态视觉语言模型收集候选语义,并采用子模态目标来选择相关、可编辑且多样化的选项,在各个领域均优于现有方法。
-
新研究为文本到图像 AI 提供高级控制和安全性
两篇新研究论文提出了增强文本到图像生成模型控制和安全性的新颖方法。第一种方法 DiSCO,通过对比评分优化提示,提供了一种黑盒防御来防止生成不安全内容(NSFW),在保持图像质量的同时显著减少了有害输出。第二种方法 Concept Guidance (CoG) 是一种无需训练的方法,通过强化扩散模型中与概念相关的层来精确控制图像生成,在不改变模型本身的情况下提高了美学吸引力和局部连贯性。
-
Unsloth 提供本地UI,用于训练和运行多样化的LLM及扩散模型
Unsloth 是一个新推出的开源本地用户界面,专为运行和训练大型语言模型及扩散模型而设计。它支持多种模型,包括 Qwen3.8, Kimi K3, MiniMax-H3, Gemma 4, DeepSeek-V4 和 FLUX。该项目可在 GitHub 上获取,彰显了其对开源开发的承诺。
-
用户声称俄罗斯、德国和人工智能平台侵犯知识产权
用户对包括专利、版权、软件和艺术风格在内的知识产权被盗表示沮丧和愤怒。他们特别指控来自俄罗斯和德国的个人以及 Google、X、Suno 和 Nightcafe 等平台参与了此次挪用。用户希望追回其原创作品,并使用了与人工智能伦理和数字艺术相关的标签。
-
AI图像生成器指南:比较ChatGPT、Gemini、Midjourney等
文章比较了八款领先的AI图像生成器,强调每种工具都有其独特的优势。文章建议用户应根据其特定的工作流程需求来选择AI图像生成器,而不是依赖单一工具完成所有任务。该指南旨在帮助用户识别最适合其目的的生成器。
-
企业领导者被敦促在劳动力准备不足的情况下加速采用人工智能
企业领导者采用人工智能的速度和深度不够,导致已做好准备的公司与落后公司之间出现差距。ManpowerGroup Talent Solutions 的一份报告表明,只有 3% 的组织领导者对人工智能赋能的工作做好了充分准备,而劳动力准备不足是人工智能转型的首要障碍。为了保持竞争力,领导者必须将思维模式转向持续学习和适应性,培养对人工智能价值的基础理解,并积极参与人工智能工具和教育。
-
Claude Code 技能集成 300 多个媒体模型和 25 个工作流
为 Claude Code 开发的一项新技能,通过集成 300 多个不同模型并提供 25 个预构建工作流,以简化媒体生成。该工具旨在消除对各种媒体生成服务的多个注册和密钥的需求,将它们整合在一个密钥下。该技能提供了用于产品渲染、广告和电子商务视觉效果等任务的现成配方,摆脱了传统的空白提示方法。
-
新的BAG策略通过自适应缓存加速Diffusion Transformer
研究人员开发了BAG(Budget-Aware Gating),一种旨在加速Diffusion Transformer(DiTs)的新型缓存策略。与之前缺乏预算感知或实例适应性的方法不同,BAG使用轻量级门控网络动态决定是重用缓存的特征还是执行完整计算。该方法通过离线到在线调度蒸馏进行训练,在FLUX.1-dev和Wan2.1数据集上,在各种加速级别和分辨率下,始终优于现有的缓存技术。
-
新的SNR-Edit框架增强了无反演图像编辑
研究人员开发了SNR-Edit,一种使用流 기반生成模型进行无反演图像编辑的新框架。该方法通过采用结构感知噪声校正,将分割约束注入初始噪声,从而解决了现有方法的局限性。该技术将源轨迹锚定到真实图像的隐式反演位置,减少了漂移并保持了结构完整性,而无需调整模型。在PIE-Bench和SNR-Bench等基准上的评估表明,SNR-Edit具有最小的开销,效果显著。
-
Regional Prompter 在新的 AI 图像生成架构中出现兼容性问题
Regional Prompter 工具,一种控制 Stable Diffusion 中图像生成区域的流行方法,正面临与 Flux 和 DiT 等较新的 Transformer 架构的兼容性问题。虽然核心插件在 A1111 和 SDXL 等旧模型和接口上仍然可用,但迁移到基于 Flux 的管道的用户发现原始 UNet-attention-hook 机制不受支持。这导致了社区开发的 fork 和 Attention Couple、Flu…
-
MiniMax H3引领开源视频生成,迅速获得社区采用
MiniMax AI的H3模型被认为是开源视频生成领域领先的开源模型。该模型迅速获得了社区支持,开发者在发布后48小时内就迅速添加了LoRA支持和针对各种硬件平台的优化等功能。H3在保持图像、声音、音频和视频之间角色一致性方面的能力被强调为一项重大进展,使其成为AI能力前沿的有力竞争者。
-
BotHub 不透明的定价导致用户在 AI 图像生成上过度支付
图像生成聚合平台 BotHub 因其不透明的定价结构而受到批评,用户往往需要支付远高于直接供应商的价格。虽然 Nano Banana Pro 等模型与 Google 的 Gemini API 相比,溢价约为 27%,但 Flux 等模型的价格却是 Black Forest Labs 价格的 2.3 至 3.5 倍。该服务使用的专有货币 CAPS 进一步增加了成本计算的复杂性,而最初免费赠送的 CAPS 不足以对不同模型进行有意义的比较…