PulseAugur
中
实时 09:08:40
实体 Qwen Image Edit

Qwen Image Edit

PulseAugur coverage of Qwen Image Edit — every cluster mentioning Qwen Image Edit across labs, papers, and developer communities, ranked by signal.

Show in brief
总计 · 30天
31
90 天内 31
发布 · 30天
0
90 天内 0
论文 · 30天
14
90 天内 14
层级分布 · 90 天
主题
关系
情绪 · 30 天

3 天有情绪数据

最近 · 第 1/2 页 · 共 37 条
  1. TOOL · CL_273844 ·

    AnyAngle LoRA 增强 AI 图像生成相机控制

    一款名为 AnyAngle 的新 LoRA 模型已被开发出来,用于增强 Qwen Image Edit 模型在 AI 图像生成中对相机角度的控制。该方法涉及将初始图像转换为 3D 模型或高斯溅射,然后在 Blender 中进行操作以达到所需的相机角度。生成的图像用作参考,指导 Qwen Image 2.1 在保持风格一致性的同时改变原始图像的透视。训练过程利用真实的 Blender 渲染图和来自 MiniMax H3 模型的图像来确保…

  2. RESEARCH · CL_268209 ·

    新的AI方法增强图像恢复能力和适应性 · 跟踪4个来源

    研究人员开发了几种新的图像恢复方法,重点是提高模型的收敛性和适应性。一种方法为具有退火噪声水平的即插即用算法建立了收敛保证,适用于确定性和随机方法。另一种技术ImIR使用低秩适配器和图像派生指令来调整大型预训练图像编辑模型,从而实现任务无关的恢复。此外,一个名为Restoring without Forgetting (RwF) 的框架通过识别和调整特定于任务的滤波器来解决持续学习中的灾难性遗忘问题。最后,TaskIR提供了一个两阶段…

  3. TOOL · CL_251657 ·

    AI 图像生成器解锁 POV 功能,寻求开源解决方案

    AI 图像生成的最新进展使得创建视角(POV)图像成为可能,这些图像从特定角色的视角描绘场景。虽然 Meta 的 Muse Image 和 Nano Banana 已展示了此功能,但其成本对于大规模使用而言过高。用户正在寻找开源替代方案,发现 Qwen Image Edit、FLUX.2 9B Base 和 Hunyuan Image 3.0 Instruct 等模型未能生成准确的 POV 图像。尝试使用 Gemma 4 等语言模型来…

  4. TOOL · CL_229517 ·

    新的VTON评估框架DAT超越Gemini、Qwen和GPT-5.5

    研究人员开发了一个名为DAT的新框架,以更有效地评估虚拟试穿(VTON)模型。现有的FID和SSIM等指标难以捕捉服装的保真度,因此DAT将一致性分解为七个特定维度,包括轮廓、颜色和纹理。该框架在一个大型数据集上进行了训练,并可以集成到强化学习中以优化VTON模型,在评估中超越了Gemini 3.1、Qwen3.7-Plus和GPT-5.5等专有模型。

  5. TOOL · CL_228263 ·

    Continuity AI工具集成了六个模型家族,增加了对话和摄像机运镜生成功能

    Continuity(原名H3节点)已更新,支持六个不同的AI模型家族以完成各种创意任务。这包括用于带声音的视频生成、静态图像创建和图像编辑的模型,所有这些都可以通过统一的提示界面和本地模型权重进行访问。一项新功能允许用户生成带有说话人识别和语言规格的对话,并且blockout bench工具可以将简单的舞台指示转换为详细的摄像机运动和布景描述。

  6. TOOL · CL_215432 ·

    Qwen-Video-Edit 重新利用图像模型实现基于指令的视频编辑

    研究人员开发了 Qwen-Video-Edit,一种新颖的基于指令的视频编辑方法,该方法重新利用了现有的图像编辑模型。该方法通过将视频-VAE 的潜在表示投影到 DiT 的 token 空间,来教会 Qwen-Image-Edit transformer 直接操作视频-VAE 的潜在表示。该模型使用指令三元组进行微调,然后通过去噪增强进行优化,使其能够根据文本命令执行编辑。

  7. TOOL · CL_211233 ·

    用户分享使用 MiniMax H3 和 Qwen Image Edit 的创意过程

    一位 Reddit 用户分享了他们根据“红发会”短篇故事生成角色参考表的创意过程。他们使用了 MiniMax H3 进行角色生成,并使用 Qwen Image Edit 进行空间连续性处理,采用了包括 Nano Banana、12 步和 ref2va turbolora v0.1 模型的工作流程。生成过程在 3090 GPU 上以 1 MP 的分辨率进行,每次生成耗时 10 秒,每秒迭代 107 次。

  8. TOOL · CL_208677 ·

    新的AViTS框架提高了Diffusion Transformer在图像生成方面的效率

    研究人员开发了AViTS,一个旨在提高用于图像生成的Diffusion Transformers (DiTs) 效率的新框架。该方法自适应地选择时空令牌,优先处理分辨率细化所需的关键令牌,而推迟处理不太重要的令牌。AViTS旨在减少冗余计算,并提高DiTs动态分辨率采样中的质量-效率权衡。该框架已在FLUX上实现了高达6.34倍的FLOPs减少,在Qwen Image Edit和FLUX.1-Kontext-dev上实现了近9倍的FL…

  9. TOOL · CL_208672 ·

    新的AI技术为复杂的摩尔纹去除生成训练数据

    研究人员开发了一种新方法,为旨在去除图像中复杂摩尔纹的人工智能模型生成高质量的训练数据。该方法利用生成式基础模型创建逼真的摩尔纹图案及其对应的干净版本,解决了从现实场景中获取配对数据的挑战。由此产生的WildMoiré数据集包含6.8K个训练对,已被证明能显著提高ESDNet、SDXL和Qwen Image Edit等现有去摩尔纹模型的性能。

  10. MEME · CL_201821 ·

    Reddit 用户寻求最佳图像到图像 AI 模型

    Reddit 的 r/StableDiffusion 子版块上一位用户正在寻求当前最佳图像到图像模型的推荐。他们一直在使用 Qwen-Image-Edit 来完成角色一致性和图像修复等任务,但正在寻找近期可能出现的更优的替代方案。

  11. TOOL · CL_196217 ·

    NullEdit 通过隐蔽的无操作方法保护图像免受VLM操纵

    研究人员开发了NullEdit,一种新颖的方法,用于保护图像免受视觉语言模型(VLM)的未经授权操纵。与现有会破坏图像或无法阻止编辑的防御措施不同,NullEdit旨在采用一种隐蔽的无操作方法。它重定向VLM的内部表示,确保输出保持自然,并在没有明显伪影的情况下保留原始内容和身份。在CelebA-HQ和VGGFace2数据集上使用Step1X-Edit和Qwen Image Edit进行了测试,NullEdit显著降低了EditRew…

  12. RESEARCH · CL_200328 ·

    新数据集和框架推动图像和视频编辑能力发展

    研究人员开发了多个新的数据集和框架,以推动图像和视频编辑能力的进步。OpenGPT-4o-Image 是一个大规模数据集,采用新颖的方法,结合分层任务分类和自动生成,创建指令-图像对,以提高多模态 AI 性能。CPI-Bench 为真实世界的图像编辑提供了一个全面的基准,评估多图像任务、实际应用和基于推理的编辑,以更好地区分模型性能。SI-Edit 引入了一个用于草图指令引导的局部图像编辑的数据集和框架,具有像素级精度,而 Conce…

  13. MEME · CL_181539 ·

    Scail 2 AI 用于为 GTAVI 创建胖乎乎的角色

    一位 Reddit 用户使用 Scail 2 AI 模型创建了一个视频和配套的图片编辑,展示了《侠盗猎车手 VI》(GTAVI) 中的角色被修改成“胖乎乎”的样子。该视频耗时两周制作,图片编辑则结合使用了 flux klein、Qwen image edit、Krea identity edit 以及 ChatGPT image 等 AI 工具进行辅助。

  14. TOOL · CL_180923 ·

    Nano Banana Pro 在新的图像空间规则发现基准测试中领先

    一个名为 WISRD 的新基准已被开发出来,用于测试图像编辑模型的规则发现能力。该基准包括 11 个核心任务和补充探针,旨在评估空间操纵、模式推理和逻辑推理能力。在评估中,Nano Banana Pro 的表现优于其他模型,在该基准的一个子集上达到了 48.7% 的通过率,显著高于 Qwen Image Edit 和 FLUX.2 Klein 4B。

  15. RESEARCH · CL_178522 ·

    新的EVR方法通过LLM验证增强多参考图像编辑

    研究人员开发了一种名为评估-验证奖励(EVR)的新方法来改进多参考图像编辑。该方法使用多模态大语言模型(MLLMs)生成假设,然后根据视觉证据进行验证,从而创建可靠的奖励信号。这使得现有的图像编辑器能够进行强化学习微调,与Qwen Image Edit和NanoBanana等先前模型相比,在一致性和视觉和谐方面有了显著改进。

  16. COMMENTARY · CL_166094 ·

    Krea 2 图像编辑模型发布及能力受质疑

    用户正在询问 Krea 2(一款新的图像编辑模型)的发布及其功能。该模型被考虑作为 Qwen Image Edit 等现有工作流程的潜在替代品,但有关其发布和功能的具体细节仍然稀少。

  17. TOOL · CL_165609 ·

    使用 Stable Diffusion 和 Qwen Image Edit 生成的 Psylocke 图像

    一位 Reddit 用户分享了一张使用 Stable Diffusion 和 CyberRealistic CatalystIllust V10 模型生成的角色 Psylocke 的图像。该图像使用 Qwen Image Edit 进行了进一步优化,并融入了多种 LoRA 以增强真实感和风格,包括 Realistic Skin Texture、Glossy Oil Sheen Skin 和 Neon Cyber Fantasy。

  18. TOOL · CL_159639 ·

    Qwen Image Edit Plus 可通过文本命令编辑图像中的文本

    “Jimniting”(源自Gemini)已成为通过文本命令编辑图像的热门俚语,尤其用于更改图像内的文本。阿里巴巴的开源模型Qwen Image Edit Plus被重点介绍,它能够添加、删除和替换图像中的文本,并旨在保留原始字体、大小和样式。虽然Qwen Image Edit在中文和英文文本编辑的基准测试中表现强劲,但其对西里尔文文本的有效性仍未经验证,并且中国大陆以外的用户可能需要通过变通方法才能访问。

  19. TOOL · CL_158242 ·

    Mix Studio 为 ComfyUI 提供免费开源 AI 工作空间

    Mix Studio 是一个新推出的、免费且开源的 AI 工作空间,旨在为 ComfyUI 提供更用户友好的界面。它专为桌面和移动设备设计,通过为 Krea 2、FLUX.2、Qwen Image Edit、LTX 2.3、Wan 2.2 和 SCAIL 2 等各种模型提供精选工作流程,简化了生成过程。该工作室包含区域提示、LoRA 管理、上下文提示建议以及用于组织过去生成及其确切设置的库等高级功能。

  20. TOOL · CL_130356 ·

    Apple 发布 MT-EditFlow 以改进多轮 AI 图像编辑

    Apple 研究人员开发了 MT-EditFlow,一个使用强化学习来改进多轮图像编辑的新框架。该方法通过优化整个编辑序列的奖励信号,解决了诸如错误传播和单轮编辑的“全或无”性质等问题。实验表明,MT-EditFlow 在包括 FLUX.1-Kontext-dev 的显著改进在内的各种基础模型上显著提高了性能,并且优于 Qwen-Image-Edit 等模型。