InstructPix2Pix
PulseAugur coverage of InstructPix2Pix — every cluster mentioning InstructPix2Pix across labs, papers, and developer communities, ranked by signal.
-
新数据集和框架推动图像和视频编辑能力发展
研究人员开发了多个新的数据集和框架,以推动图像和视频编辑能力的进步。OpenGPT-4o-Image 是一个大规模数据集,采用新颖的方法,结合分层任务分类和自动生成,创建指令-图像对,以提高多模态 AI 性能。CPI-Bench 为真实世界的图像编辑提供了一个全面的基准,评估多图像任务、实际应用和基于推理的编辑,以更好地区分模型性能。SI-Edit 引入了一个用于草图指令引导的局部图像编辑的数据集和框架,具有像素级精度,而 Conce…
-
Nano Banana Pro 在新的图像空间规则发现基准测试中领先
一个名为 WISRD 的新基准已被开发出来,用于测试图像编辑模型的规则发现能力。该基准包括 11 个核心任务和补充探针,旨在评估空间操纵、模式推理和逻辑推理能力。在评估中,Nano Banana Pro 的表现优于其他模型,在该基准的一个子集上达到了 48.7% 的通过率,显著高于 Qwen Image Edit 和 FLUX.2 Klein 4B。
-
新AI工具Envisage通过新颖的评估指标可视化鼻整形效果
研究人员开发了Envisage,一个使用基于扩散模型的生成编辑来可视化鼻整形手术预期结果的新流程。该系统旨在提供局部编辑,并包含一个新颖的评估协议SurgicalScore,该协议将评估分解为编辑方向、幅度、掩码LPIPS、真实性和掩码外像素的保留。Envisage在关键指标上展示了优于现有方法(如ICEdit和InstructPix2Pix)的性能,表明局部编辑保真度比全脸身份分数更适合此类应用。
-
新基准解决 AI 图像编辑中的隐私盲点
研究人员推出了 SPPE,这是一个用于评估多模态大型语言模型 (MLLM) 中隐私保护图像编辑的新基准。该基准解决了标准隐私方法通常会导致编辑后的代理图像而不是所需的编辑后源图像的问题。SPPE 包括在云交互之前评估可编辑性的任务,以及从代理中恢复编辑后的源图像的任务,并提出了新颖的 ERMA 和 C2E-S2SER 方法来应对这些挑战。
-
Apple 研究人员为扩散模型泛化识别局部分数
Apple 的研究论文探讨了条件扩散模型中组合泛化机制,特别关注这些模型如何处理生成比训练时更多的对象的图像。研究确定“局部条件分数”是实现此能力的关键因素,表明成功进行长度泛化的模型表现出这些分数,而失败的模型则没有。研究还提出了一种强制执行这些局部分数的方法,该方法成功地使先前表现不佳的模型实现了长度泛化。