Qwen-Image-Layered
PulseAugur coverage of Qwen-Image-Layered — every cluster mentioning Qwen-Image-Layered across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
UniWorld-Design框架实现图层原生图像生成
研究人员推出了一种新颖的框架UniWorld-Design,它将图像生成从扁平像素转移到结构化RGBA图层。这种方法使模型能够像人类设计师一样,通过图层来理解和编辑图像。该框架包含两个模型:T2RGBA用于从文本生成RGBA素材,I2L用于根据指令将现有图像分解为语义RGBA图层。在评估中,I2L在Crello基准测试中显著减少了错误并提高了IoU,而T2RGBA在CLIP Score方面取得了最佳性能。
-
Stable-Layers 框架使用 VLM 反馈进行图像层分解
研究人员开发了 Stable-Layers,一个用于微调图像层分解模型的新型强化学习框架。该方法利用视觉语言模型 (VLM) 的反馈,绕过了对配对监督的需求。该框架应用于 Qwen-Image-Layered,采用 Flow-GRPO 和 LoRA 适配,以及一个独特的两阶段评估流程来解决 VLM 奖励信号压缩的挑战。与原始模型相比,结果表明 Stable-Layers 在 Crello 数据集上实现了更好的层分离、更少的伪影和更低的重建误差。
-
Stable-Layers 使用 VLM 反馈改进图像层分解
研究人员开发了 Stable-Layers,一个旨在改进图像层分解模型的新型强化学习框架。该系统通过利用视觉语言模型 (VLM) 的反馈,绕过了对配对训练数据的需求。通过采用 Flow-GRPO 和 LoRA 适配,Stable-Layers 优化了策略训练,并在 Crello 数据集上与基础模型相比,展示了增强的层分离和减少的重建误差。
-
MRT 模型以 200 亿参数推进分层图像生成
研究人员推出 MRT,这是一种拥有 200 亿参数的掩码区域扩散模型,专为可扩展的分层图像生成和编辑而设计。该模型在一个框架内统一了文本到图层、图像到图层和图层到图层任务,并利用选择性 token 掩码进行灵活的图层操作。MRT 还配备了溢出感知画布,以处理超出可见边界的图层,并采用扩散蒸馏实现快速的 8 步生成。