GPT-Image-2
PulseAugur coverage of GPT-Image-2 — every cluster mentioning GPT-Image-2 across labs, papers, and developer communities, ranked by signal.
- competes with Qwen-Image-3.0-Pro 90%
- competes with SenseNova U1 Pro 90%
- developed by DALL·E 3 90%
- developed by Muse Image 90%
- developed DALL·E 3 90%
- competes with SenseNova U1 90%
- competes with FLUX.2 80%
- uses Nano Banana 70%
- competes with Nano Banana 70%
- competes with Muse Image 70%
- uses Seedance 70%
- used by Seedance 70%
- 2026-08-21 product_launch OpenAI released an API update for GPT-Image-2 that includes native transparency support. 来源
- 2026-08-21 product_launch OpenAI is previewing transparent background support for GPT-Image-2 through its API. 来源
- 2026-08-21 product_launch OpenAI is previewing transparent background support for GPT-Image-2 through its API. 来源
- 2026-08-07 product_launch OpenAI released GPT Image 2, a successor to DALL·E 3, with enhanced capabilities. 来源
- 2026-08-06 product_launch OpenAI launched GPT Image 2 on April 21, 2026, featuring a new multimodal moderation system. 来源
- 2026-07-27 product_launch OpenAI announced GPT Image 2, a new model for image generation and editing. 来源
- 2026-06-19 product_launch OpenAI's GPT Image 2 model is now available on Together AI's platform. 来源
- 2026-06-19 product_launch OpenAI's GPT Image 2 model is now available on the Together AI platform. 来源
- 2026-06-11 product_launch GPT Image 2 is highlighted as a leading AI model for image generation, particularly noted for its text rendering capabilities. 来源
6 天有情绪数据
-
AI室内设计渲染在几何形状和家具准确性方面存在挑战
一位Reddit用户正在寻求建议,如何在使用AI生成室内渲染图时,保持精确的几何形状并准确地呈现特定的家具设计。他们尝试了3D模块化工作流程,然后使用GPT Image 2.5、Qwen 2.1 Edit和Krea 2 Edit等AI图像编辑工具,但发现这些工具经常会改变场景的几何形状或错误地呈现家具。用户正在寻找一种可重复的工作流程,以确保相机视角、物体放置、比例和旋转能够可靠地保留,同时还能提高真实感和光照效果。
-
统一的AI API网关简化了对109个模型的访问
一个名为LiuRun.click的新API网关提供了一个统一的接口,可以访问来自OpenAI、Anthropic和Google等不同提供商的100多个AI模型。开发人员可以使用单个API密钥和端点,只需进行最少的代码更改,即可在Claude Sonnet-5、GPT-5.5和Gemini 2.5-Flash等模型之间切换。该服务还提供每个模型的详细成本跟踪,并支持带有缓存读取费用减免的提示缓存。
-
AI的生产效用不断增长,但对未经核实的输出的担忧也随之而来 · 跟踪1个来源
近期AI的发展凸显了其在实际生产工作中的应用,以及对未经核实的AI输出的担忧日益加剧。一位用户成功在Illustrator中使用Astra将GPT-Image-2生成的图像转换为可编辑的矢量图,这表明AI艺术的可编辑性有了关键的提升。相比之下,游戏“Level-5”因大量使用生成式AI而受到批评,观众抱怨其缺乏真正的游戏性和效率。与此同时,一位插画家的观察表明,市场正逐渐远离AI生成内容,出版商在合同中越来越多地要求提供非AI使用的证明。
-
ChatGPT Images 2.5的伪造检测能力得到评估
一篇新的研究论文评估了ChatGPT Images 2.5的图像生成能力,特别关注其在伪造检测任务中的表现。研究发现,虽然ChatGPT Images 2.5中的Flare和Sunburst API模型与GPT-Image-2相比,在OCR检测到的周围文本变化方面有所减少,但它们在目标字段的正确性方面并未显示出显著的改进。该研究强调了对宣传的AI能力进行特定任务评估的必要性,尤其是在应对图像操纵方面。
-
GPT Image 2、Nano Banana 2和FLUX.2引领图像生成模型
在图像生成方面,没有单一的最佳模型,而是根据具体需求进行选择。OpenAI的GPT Image 2提供最高的质量和最佳的提示遵循度,尽管它是最昂贵且最慢的。Google的Nano Banana 2 (Gemini 3.1 Flash Image)以显著较低的成本提供了接近顶级的质量和编辑能力的强大平衡,使其成为一个不错的默认选择。对于那些需要开源模型进行自托管的用户,FLUX.2是领先的选择,并提供各种许可选项。
-
Qwen-Image-3.0-Pro 领跑开源图像生成,比 GPT-Image-2 落后 92 ELO 分 · 跟踪 2 个来源
Qwen-Image-3.0-Pro 已被确定为领先的开源图像生成模型,尽管在盲人偏好测试中比 OpenAI 的 GPT-Image-2 落后 92 ELO 分。此次评估基于人类偏好而非营销宣传,凸显了 Qwen-Image-3.0-Pro 在可下载模型中的强劲表现。该排名是更广泛的开源生成式人工智能能力评估的一部分。
-
Microsoft AI 发布 MAI-Image 2.6 和 Flash 用于图像生成
Microsoft AI 发布了两个新的图像生成模型 MAI-Image-2.6 和 MAI-Image-2.6-Flash,可通过 Microsoft Foundry 使用。MAI-Image-2.6 定位为生成和编辑高质量图像的前沿模型,在文本到图像和编辑任务的排行榜上名列前茅。MAI-Image-2.6-Flash 专为更高的吞吐量和效率而设计,适用于交互式应用和大规模个性化。这两个模型都提供多参考编辑和网络基础等功能,具有不同…
-
Astra 展示了使用 Blender 和 GPT-Image-2 进行的高级 3D 游戏开发
Astra 开发了一款采用 three.js 的游戏,具有精美的图形,并且每个场景和预告片也使用 Blender 重建。该项目代表了与之前的 Sol 等项目相比,在 3D 图形和前端设计方面取得了重大进展,展示了更精炼的用户界面。游戏的素材是程序化生成的,使其核心大小保持在 2 MB 以下,UI 元素则使用 GPT-Image-2 创建。
-
OpenAI 的 GPT Image 2.5 据称可生成高度逼真的伪造内容
据报道,OpenAI 已开发出新的图像生成模型 GPT Image 2.5,该模型能够创建高度逼真且令人信服的虚假内容,包括模拟新闻发布会和官方通讯。早期测试表明,与前代 GPT Image 2 相比,其逼真度、生成速度以及在多张图像中处理文本和面部一致性的能力均有显著提升。这一进展表明,先进的图像生成技术可能成为 OpenAI 未来版本的重要功能,并可能与 GPT-6 等模型一同发布。
-
新基准揭示生成图像模型在身份保持方面存在困难
一篇新的研究论文介绍了一个基准和评估系统,用于评估生成图像模型在各种编辑和生成任务中保持主体身份的能力。研究强调,当前模型在身份保真度方面存在困难,在迭代编辑或复杂场景下,身份退化会加剧。该论文提出,可跨代使用的持久身份层可以显著提高主体保持能力,同时不损害图像质量或指令遵循度,这表明身份是独立的知识组成部分,而非模型能力的涌现属性。
-
SenseNova U1 Pro 图像模型在短暂炒作周期后消失
SenseNova U1 Pro,一个中国的AI图像生成模型,在报道前约三周引起了巨大轰动,声称拥有“GPT Image 2级别”的能力和原生8K分辨率。尽管有令人印象深刻的样本图像,尤其是在文本渲染方面,但该模型并未公开发布,也没有可用的权重或API访问。这种沉默导致用户感到沮丧,并将其与OpenAI的Sora进行比较,Sora在最初令人印象深刻的演示后也经历了长时间的沉默,随后发布但影响不大,最终被关闭。
-
Qwen-Image-3.0-Pro 在开源图像生成领域挑战 GPT-Image-2
Qwen-Image-3.0-Pro 模型被评为领先的开源图像生成模型,紧随 OpenAI 的 GPT-Image-2 之后。尽管 Qwen-Image-3.0-Pro 可供下载,但在盲人偏好测试中,其得分比 GPT-Image-2 低 87 ELO 分。此次比较凸显了开源和专有图像生成技术的持续竞争和进步。
-
AI框架使用代码和视觉模型生成可编辑的平面设计
研究人员开发了使用AI生成可编辑平面设计的新框架。其中一种方法,Editable Visual Design,采用由视觉语言模型指导的编码代理,以原生HTML/CSS创建分层设计,允许迭代细化和用户调整。另一个系统,DesignAsCode,将平面设计视为一个程序化合成任务,使用HTML/CSS和Plan-Implement-Reflect管道来平衡视觉保真度和结构可编辑性。这两种方法都旨在克服现有AI设计工具的局限性,这些工具通常会…
-
OpenAI 的 GPT-Image-2 通过 Codex 无法使用参考图像
用户报告称,OpenAI 的 GPT-Image-2 模型在通过 Codex 访问时,未能有效利用参考图像。该模型似乎忽略了提供的参考图像的风格元素、调色板和内容,而是默认输出其自身的标准结果。这种行为与之前的版本不同,导致用户质疑问题出在模型本身还是其在 Codex 中的集成。
-
Qwen-Image-3.0-Pro 在人类偏好测试中落后于 GPT-Image-2 和 MAI-Image-2.6-Preview · 跟踪 2 个来源
Qwen-Image-3.0-Pro 是一款开源图像生成模型,已与其他领先模型进行了评估。在图像生成的 人类偏好测试中,其得分比 OpenAI 的 GPT-Image-2 低 88 ELO 分。在图像编辑方面,Qwen-Image-3.0-Pro 比 Microsoft AI 的 MAI-Image-2.6-Preview 低 35 ELO 分。这些排名基于盲人偏好,而非营销宣传。
-
商汤发布开源8B文生图模型SenseNova U1.5 Lite
商汤发布了其开源8B文生图模型SenseNova U1.5 Lite的正式版本。该更新模型在理解长而复杂的指令、生成更高质量的视觉效果以及执行更精确的图像编辑方面提供了改进的功能,同时保持了原生4K分辨率输出。模型的进步归功于一种训练方法,该方法首先开发专门的“专家”模型来处理文本渲染和图像编辑等任务,然后使用多教师蒸馏策略将这些技能重新整合到一个统一的8B模型中。
-
Qwen-Image-3.0-Pro 在开源图像生成方面比 GPT-Image-2 落后 84 ELO 分
Qwen-Image-3.0-Pro 是一款开源图像生成模型,经评估发现其比 GPT-Image-2 落后 84 ELO 分。尽管存在差距,Qwen-Image-3.0-Pro 仍被列为用户可以下载和使用的顶级模型。评估基于盲人偏好,区别于营销宣传。
-
OpenAI 的 GPT-Image-2 API 增加了原生透明度支持
OpenAI 已通过 API 为其 GPT-Image-2 模型引入了原生透明度支持。此功能在图像创建过程中生成 alpha 通道,保留了之前给专业平面设计师带来挑战的细节。
-
OpenAI 的 GPT-Image-2 通过 API 新增透明背景生成功能
OpenAI 正在预览其 GPT-Image-2 模型的一项新功能,该功能允许生成带有透明背景的图像。此功能正通过该模型的 API 提供。OpenAI 表示,这种集成的透明度方法优于传统的背景移除方法,并且可以通过单个参数激活该功能。
-
新框架WithEveryone改进多人图像生成
研究人员开发了WithEveryone,一个旨在改进包含多个角色的多人图像生成的新颖框架。该系统解决了当前模型在保持个体身份及其在场景中位置方面的不可靠性问题,尤其是在生成多达十个人的图像时。通过将身份锚定到布局规划并采用基于区域的身份损失,WithEveryone增强了身份相似性,并与GPT-Image-2等现有方法相比显著减少了伪影。