Qwen Image
PulseAugur coverage of Qwen Image — every cluster mentioning Qwen Image across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
-
用户质疑GGUF模型格式在消费级硬件上的效率与FP8的对比
一位Reddit用户正在质疑GGUF模型格式的实用性,指出FP8模型在他们的硬件上运行速度明显更快,尽管文件更大。他们观察到,与GGUF版本相比,Qwen Image和Flux 2 Klein 9B等模型的FP8版本速度提高了5倍,而GGUF版本则需要100-200秒以上。这种性能差异让用户想知道,当未压缩格式在他们的系统上似乎更有效率时,GGUF的优势是什么。
-
新方法通过新颖的特征缓存策略加速扩散模型 · 已追踪2个来源
两篇新的研究论文提出了加速扩散模型的新颖方法,扩散模型在图像和视频生成方面计算量很大。第一篇论文《重新思考逐令牌特征缓存》(Rethinking Token-wise Feature Caching)介绍了DuCa,一种双重特征缓存策略,通过随机令牌选择迭代地应用激进和保守的缓存,挑战了“重要”令牌总是需要计算的观念。第二篇论文《LinCa: 通过可学习分解特征缓存加速扩散模型》(LinCa: Accelerating Diffusi…
-
新AI框架增强精确区域图像编辑能力
研究人员开发了用于精确区域图像编辑的新框架,解决了局部编辑和与现有内容集成方面的挑战。MaskFlow使用一种将掩码纳入其概率路径和流匹配目标的训练框架,以确保准确的编辑和背景保留。SI-Edit专注于草图-指令引导编辑,引入了一个新数据集(SI-Data)和一个结合语义指令和几何约束以实现像素级精度的框架。BRIDGE通过分离背景和前景生成路径,并引入离散几何门控来更好地控制令牌级位置嵌入,从而解决粗粒度掩码局部编辑问题,提高对齐和源保留能力。
-
Krea2 潜在空间向量赋能 AI 图像生成中的高级照片编辑
一位用户发现了一种方法,可以提取和操纵 Krea2 等图像生成模型的潜在空间向量,从而实现类似于专业照片编辑软件的高级颜色和细节调整。这些调整,包括曝光、色温、色调、清晰度和对比度,直接在潜在空间中进行,并在扩散采样过程中完成。开发者计划发布一个用户友好的 Comfy 节点来集成这些功能,并可能支持 ZImage 和 Qwen Image 等其他模型。
-
Qwen Image Edit Plus 可通过文本命令编辑图像中的文本
“Jimniting”(源自Gemini)已成为通过文本命令编辑图像的热门俚语,尤其用于更改图像内的文本。阿里巴巴的开源模型Qwen Image Edit Plus被重点介绍,它能够添加、删除和替换图像中的文本,并旨在保留原始字体、大小和样式。虽然Qwen Image Edit在中文和英文文本编辑的基准测试中表现强劲,但其对西里尔文文本的有效性仍未经验证,并且中国大陆以外的用户可能需要通过变通方法才能访问。
-
Microsoft 发布 Mage-Flow,一款紧凑型 4B 图像生成模型
Microsoft 发布了 Mage-Flow,这是一款紧凑型 4B 规模的生成模型,专为高效的文本到图像生成和基于指令的图像编辑而设计。该模型通过协同设计的标记器 (Mage-VAE) 和多模态扩散 Transformer (NR-MMDiT) 实现了具有竞争力的质量,能够生成高达 2048 像素的原生分辨率图像。Mage-Flow 及其编辑变体 Mage-Flow-Edit 有基础版、RL 对齐版和 Turbo 版,与更大的模型相…
-
阿里云发布Qwen-Image-3.0,支持高级文本渲染
阿里云发布了其图像生成基础模型的第三代Qwen-Image-3.0。该新模型拥有增强的功能,包括支持高达4.5k token的输入,精确渲染低至10像素的小文本,以及对12种语言的原生渲染。该模型可以生成报纸和漫画条等复杂的视觉输出,并准确渲染带有LaTeX方程的学术论文。
-
新的VLM篡改检测框架取得最先进成果
研究人员开发了一个新的框架,用于检测现代视觉语言模型(VLMs)中的像素级图像篡改。该方法侧重于域泛化,以确保在不同的VLM生成操纵分布中具有鲁棒性。它采用平衡的小批量采样方案来防止有偏优化,以及一种后期注入策略,在初始训练后将检测器暴露于新数据。该方法在各种分布外VLM上的检测精度方面显著优于先前最先进的技术,显示出实质性的相对改进。
-
Krea 2 VAE 比较:用户测试四种图像生成模型
一位 Reddit 用户对 Krea 2 的四种不同的变分自编码器 (VAE) 进行了比较,Krea 2 可能是与图像生成相关的工具。测试的 VAE 包括 Qwen Image、WAN 2.1、Krea 2 HD 和 Krea 2 Real。用户发现 Qwen 和 WAN VAE 之间的差异很小,WAN 提供了略微更清晰的细节。Krea HD 增强了图像的“弹出感”,但丢失了阴影细节,而 Krea 2 Real 则因其微妙的皮肤细节但…
-
NVIDIA 发布 PID 1.5 检查点,图像质量得到提升
NVIDIA 发布了其 PID 检查点的 1.5 版本,该版本兼容 FLUX、FLUX.2 和 Qwen-Image 模型。此次更新带来多项改进,包括增强了解码图像的色彩保真度、消除图像角落的网格伪影,以及更好地渲染动漫和面部细节。
-
新高效图像生成模型Z-Image和SnapGen++发布
研究人员开发了Z-Image和SnapGen++,两种新的高效图像生成基础模型。Z-Image拥有60亿参数,挑战了高性能必须大规模的观念,以显著降低的计算开销实现了与更大商业模型相当的结果。SnapGen++通过结合紧凑的扩散Transformer架构、弹性训练框架和知识引导蒸馏管线,专注于在边缘设备上实现高保真图像生成。这两种模型都旨在使先进的图像生成技术在更广泛的硬件上更易于访问和实用。
-
新推出的微型潜在上采样器 SesquiLSR 支持 AI 图像模型
一款名为 SesquiLSR 的新型、小型、快速的潜在上采样器已被开发出来,可用于各种 AI 图像生成模型。该上采样器旨在通过避免通常涉及的潜在表示上采样中的有损 VAE 往返来提高效率。SesquiLSR 被设计为双线性或双三次等基本上采样方法的替代品,可在保持速度的同时提供更好的质量。
-
MrFlow将Z和Qwen图像生成速度提高了21倍
一种名为MrFlow的新加速方法已被开发出来,据报道,该方法在对质量影响可忽略不计的情况下,将Z图像生成的速度提高了21倍,Qwen图像生成的速度提高了10倍。这一发展在StableDiffusion社区引发了关于其有效性和潜在采用的讨论和好奇。
-
SenseNova 发布更新的图表生成模型 V2
SenseNova-U1-8B-MoT-Infographic-V2,一个更新的图表生成模型已发布。新版本在小文本渲染、复杂布局稳定性和整体视觉质量方面有所改进,并修复了意外黑色背景的问题。基准测试显示,在 BizGenEval 和 IGenBench 等指标上,其性能优于前代模型和其他模型(如 Qwen-Image),但偶尔出现文本模糊的问题仍然存在。
-
新的 Krea-2 LoRA 模型支持深度控制的图像生成
新发布的 LoRA 模型 Patil/Krea-2-depth-controlnet 允许用户在通过文本提示改变图像内容和风格的同时,保持图像的 3D 结构。这种控制是通过使用 Depth Anything V2 提取深度图并将其集成到 Krea-2 生成过程中实现的。该模型兼容 Krea-2 Raw 和 Krea-2 Turbo,即使有提示引导也能保持高度的深度一致性。
-
新的Elastic Diffusion Transformer加速生成模型
研究人员开发了一种Elastic Diffusion Transformer (E-DiT)来加速Diffusion Transformers (DiT)等生成模型。E-DiT在每个DiT块中引入了一个轻量级路由器,该路由器可以动态识别与样本相关的稀疏性,从而能够自适应地跳过计算。该框架在2D图像和3D资产生成任务上展示了高达2倍的速度提升,同时生成质量损失极小。
-
OTCache框架使用最优传输加速扩散模型
研究人员推出OTCache,一个旨在通过预测最优缓存计划来加速扩散模型的新型框架。该方法利用最优传输(OT)原理来模拟在不同推理预算下缓存策略的演变,解决了现有基于图的方法的局限性。OTCache在FLUX.1、Qwen-Image和HunyuanVideo等模型上实现了3.66倍至4.7倍的显著加速,同时与当前最先进的方法相比,还提高了生成保真度。
-
流匹配研究推动生成模型和逆问题发展 · 跟踪10个来源
近期研究探索了用于生成模型和逆问题的流匹配技术的进展。论文介绍了用于高效多模态基于仿真的后验估计的FUSE,用于具有不确定性量化的稳定逆设计的对角流匹配(Diag-CFM),以及用于约束生成的拉格朗日对偶流。其他工作侧重于用于改进期望估计的得分正则化联合采样以及扩散和流匹配采样器的渐近保持分析。此外,流匹配正应用于稀疏视图CT重建和地球物理反演,展示了其在各种科学和工程领域的通用性。
-
Reddit 讨论使用 AI 模型生成多视角人体数据集
Reddit r/StableDiffusion 版块的一位用户正在询问使用 AI 模型生成多视角人体数据集的可行性。他们正在寻找能够从不同角度持续渲染单个人物主体而帧之间没有移动的模型,类似于多摄像头捕捉设备。用户特别提到了 Stable Diffusion、Qwen Image 和 GPT Image 作为潜在候选者,但对当前结果表示不满意,并寻求能够实现这种专业数据集生成的模型或技术的建议。
-
Qwen Image 模型因角色生成方面的卓越一致性而受到赞扬
一位 Reddit 用户对 Qwen Image 模型的一致性印象深刻,指出其扁平的赛璐珞着色、胶片颗粒感和光照在多次生成中保持稳定。虽然背景和手部有时可能不一致,但角色风格却异常扎实,尤其是在动漫风格的图像方面。该用户分享了他们的经验,并询问其他人使用 Qwen 模型取得的成功。