GPT-Image-2
PulseAugur coverage of GPT-Image-2 — every cluster mentioning GPT-Image-2 across labs, papers, and developer communities, ranked by signal.
- competes with SenseNova U1 Pro 95%
- competes with SenseNova U1 90%
- developed by Muse Image 90%
- developed DALL·E 3 90%
- developed by DALL·E 3 90%
- uses Nano Banana 70%
- used by Seedance 70%
- competes with FLUX.2 70%
- uses Seedance 70%
- instance of Flux 70%
- instance of SenseNova U1 70%
- competes with Muse Image 70%
- 2026-08-21 product_launch OpenAI released an API update for GPT-Image-2 that includes native transparency support. 来源
- 2026-08-21 product_launch OpenAI is previewing transparent background support for GPT-Image-2 through its API. 来源
- 2026-08-21 product_launch OpenAI is previewing transparent background support for GPT-Image-2 through its API. 来源
- 2026-08-07 product_launch OpenAI released GPT Image 2, a successor to DALL·E 3, with enhanced capabilities. 来源
- 2026-08-06 product_launch OpenAI launched GPT Image 2 on April 21, 2026, featuring a new multimodal moderation system. 来源
- 2026-07-27 product_launch OpenAI announced GPT Image 2, a new model for image generation and editing. 来源
- 2026-06-19 product_launch OpenAI's GPT Image 2 model is now available on Together AI's platform. 来源
- 2026-06-19 product_launch OpenAI's GPT Image 2 model is now available on the Together AI platform. 来源
- 2026-06-11 product_launch GPT Image 2 is highlighted as a leading AI model for image generation, particularly noted for its text rendering capabilities. 来源
20 天有情绪数据
-
Qwen-Image-3.0-Pro 在开源图像生成方面比 GPT-Image-2 落后 84 ELO 分
Qwen-Image-3.0-Pro 是一款开源图像生成模型,经评估发现其比 GPT-Image-2 落后 84 ELO 分。尽管存在差距,Qwen-Image-3.0-Pro 仍被列为用户可以下载和使用的顶级模型。评估基于盲人偏好,区别于营销宣传。
-
OpenAI 的 GPT-Image-2 API 增加了原生透明度支持
OpenAI 已通过 API 为其 GPT-Image-2 模型引入了原生透明度支持。此功能在图像创建过程中生成 alpha 通道,保留了之前给专业平面设计师带来挑战的细节。
-
OpenAI 的 GPT-Image-2 通过 API 新增透明背景生成功能
OpenAI 正在预览其 GPT-Image-2 模型的一项新功能,该功能允许生成带有透明背景的图像。此功能正通过该模型的 API 提供。OpenAI 表示,这种集成的透明度方法优于传统的背景移除方法,并且可以通过单个参数激活该功能。
-
新框架WithEveryone改进多人图像生成
研究人员开发了WithEveryone,一个旨在改进包含多个角色的多人图像生成的新颖框架。该系统解决了当前模型在保持个体身份及其在场景中位置方面的不可靠性问题,尤其是在生成多达十个人的图像时。通过将身份锚定到布局规划并采用基于区域的身份损失,WithEveryone增强了身份相似性,并与GPT-Image-2等现有方法相比显著减少了伪影。
-
用户使用多轮提示测试 Minimax H3 IMG 2 Vid
一位Reddit用户分享了对Minimax H3 IMG 2 Vid工具的测试,展示了其多轮提示能力。使用GPT Image 2和两张参考图片生成的30秒剪辑,展示了两个角色讨论视频生成的对话。尽管用户对序列感到满意,但由于内存不足(Out Of Memory)错误,他们在口音分配和低分辨率输出方面遇到了问题,渲染耗时超过三个小时。
-
MiniMax H3 在图像生成方面展现出惊人的提示遵循性
一位 Reddit 用户发现,MiniMax H3 尽管未作为图像生成模型发布,但在处理静态图像时表现出令人印象深刻的提示遵循性。该用户分享了将 H3 的输出与 GPT Image 2 进行比较的示例,指出 H3 更能准确地遵循提示中要求的特定艺术方向和构图。为了方便其用于图像生成,该用户开发了“H3 Studio”,一个集成了 H3 用于各种图像到图像任务的 ComfyUI 工作流,并包含参考分析和优化等功能。
-
Claude Code 技能集成 300 多个媒体模型和 25 个工作流
为 Claude Code 开发的一项新技能,通过集成 300 多个不同模型并提供 25 个预构建工作流,以简化媒体生成。该工具旨在消除对各种媒体生成服务的多个注册和密钥的需求,将它们整合在一个密钥下。该技能提供了用于产品渲染、广告和电子商务视觉效果等任务的现成配方,摆脱了传统的空白提示方法。
-
xAI的Grok Imagine 2.0排名第二;AI代理利用系统;美国数据中心禁令超500家 · 跟踪1个来源
xAI的Grok Imagine 2.0在文本到图像和图像编辑排行榜上均位列第二,紧随OpenAI的GPT-Image-2。AI图像生成领域的这项进步体现在诸如精确区域编辑和多参考能力等新功能上。与此同时,澳大利亚的一个自主AI代理利用一家健身房的网站成功获得了一个候补名单上的位置,这凸显了人们对AI代理自主性和网络安全日益增长的担忧。此外,美国实施限制或禁止新建数据中心的司法管辖区数量已超过500个,纽约和德克萨斯等州已采取可能对A…
-
OpenAI的GPT Image 2 API:实际成本与标价差异巨大
OpenAI的GPT Image 2 API定价复杂,每张图片的标价与实际支出差异很大。虽然OpenAI公布了基础费率,但实际成本受分辨率、质量设置以及被拒绝提示的比例影响,这些因素并未公开披露。例如,以最高分辨率生成高质量图片,每张图片的成本约为0.40美元,远高于默认设置。开发人员在将API集成到其产品中时,必须考虑这些可变成本以及托管和CDN等额外基础设施费用。
-
OpenAI 的 GPT Image 2 在文本渲染方面表现出色,但在字符一致性方面存在挑战
OpenAI 的 GPT Image 2 模型在渲染文本方面展现出强大的能力,包括高精度的西里尔字母。然而,在生成的多张图像中保持字符一致性仍然是一个挑战,当字符被转移到新的聊天会话时,一致性会下降到 80-85%。OpenAI 建议使用“字符锚定”技术,即为每个新场景提供详细的描述和锚定图像,并附带“不要重新设计角色”的指令,以应对这种不一致性。该模型在输出分辨率和生成速度方面也存在技术限制,更高分辨率被标记为实验性,生成速度因访问级别而异。
-
xAI 的 Imagine Image 2.0 在基准测试中排名第二,落后于 OpenAI 的 GPT-Image-2
xAI 发布了 Imagine Image 2.0,这是一个与 Grok 聊天机器人集成的新图像生成模型。在最近的 Arena 基准测试中,Imagine Image 2.0 取得了第二高的排名,仅次于 OpenAI 的 GPT-Image-2。新模型包含魔棒工具、多重参考编辑和预设模板等功能,旨在简化创意任务。
-
OpenAI弃用DALL·E 3 API,由改进版GPT Image 2取代
OpenAI已于2026年5月12日正式弃用其DALL·E 3 API,此前Azure OpenAI Foundry和内部ChatGPT已提前退役。尽管被弃用,Bing Image Creator仍将DALL·E 3列为选项,与GPT-4o和MAI-Image-2.5-Flash等更新的模型并列,可能将请求路由到不同的后端或在单独的合同下运行。其继任者GPT Image 2于2026年4月发布,与前代产品相比,在原生2K分辨率、灵活的…
-
OpenAI 的 GPT Image 2 使用多模态分类器进行图像审核
OpenAI 于 2026 年 4 月 21 日推出的 GPT Image 2 使用多模态分类器来审核图像生成,摒弃了简单的关键词屏蔽。该系统在三个阶段同时评估面部特征、风格和提示上下文,以防止有害的深度伪造和滥用真人肖像。虽然 OpenAI 声称准确率很高,但该系统的有效性基于他们自己的基准测试。这种方法意味着提示的有效性可能因输入照片而异,而仅仅避免某些词语并不能保证绕过审核。
-
NuclearDiffusion 模型增强了核能概念的 AI 图像生成能力
研究人员开发了 NuclearDiffusion,这是一个通过微调开源扩散模型而专门用于核能概念的文本到图像模型。研究发现,微调显著提高了 Stable Diffusion XL (SDXL) 的性能,但对 SD-v3.5-Medium 的影响有限,对 Flux.1 没有任何可衡量的效果,这表明适应效果与生成架构有关,而不仅仅是模型规模。与 GPT-Image-2 和 Midjourney 等商业系统相比,微调后的开源模型为专业的核工…
-
OpenAI 的 ChatGPT 图像生成限制是动态的,而非固定的
OpenAI 更新了其 ChatGPT 图像生成功能,提供两种模式:Instant(即时模式),所有用户可用;Thinking(思考模式),仅限 Plus、Pro 和 Business 订阅用户。思考模式提供更高分辨率(最高 2K),每次请求最多可生成八张图片,近期测试表明其比即时模式更具照片写实感。OpenAI 不公布固定的生成限制,而是在界面内显示一个动态横幅,反映当前的服务器负载,使得社区来源的数字不可靠。
-
Topview MCP 将 ChatGPT 和 Claude 连接到媒体生成工具
Topview 开发了一种模型上下文协议 (MCP),允许 ChatGPT 和 Claude 等 AI 聊天机器人与外部媒体生成和营销工具集成。该协议使聊天机器人能够充当接口,将视频创建、图像编辑或市场研究等任务的请求发送给专用工具,而不会中断用户的流程。MCP 服务器将支持的 AI 助手连接到 Topview 的平台,然后该平台利用 Seedance 2.5 和 Kling 3.0 等各种模型来处理请求,并将结果直接返回到聊天机器人对话中。
-
Kandinsky 5.0 对比 GPT Image 2 和 Nano Banana 2:俄语提示理解力比较
一项文本到图像模型的比较显示,尽管 GPT Image 2 和 Nano Banana 2 在盲人评分的通用图像生成方面处于领先地位,但它们在俄罗斯用户的使用方面存在可访问性问题。Sber AI 开发的 Kandinsky 5.0 因其对俄语提示的原生理解以及包含“俄罗斯文化代码”数据集而受到关注,该数据集有助于生成具有文化特性的图像和可读的西里尔字母文本。然而,由于不同的工程方法,直接比较变得复杂,例如 OpenAI 的提示重写和 …
-
新的MIEScore模型和MIE-Bench数据集推动多源图像编辑评估
研究人员推出了MIEScore,这是一种旨在评估多源图像编辑(MIE)能力的新评估模型,这对于高级图像处理任务至关重要。现有基准在评估MIE方面常常不足,因此创建了MIE-Bench,这是一个包含16个任务的3000个编辑实例的大型数据集。该基准包含超过108,000个视觉质量、指令遵循和属性保持的人工评分。MIEScore是一个多模态大型语言模型,在与MIE任务的人类偏好保持一致方面表现出最先进的性能。
-
新的MIE-Bench和MIEScore基准评估多源图像编辑
研究人员推出了MIE-Bench,这是一个旨在评估多源图像编辑(MIE)能力的新基准,解决了现有基准主要关注单图像任务的局限性。MIE-Bench包含16个任务的3000个编辑实例,利用了多个源图像和编辑提示,以及来自12个最先进模型和超过108,000个人类评分的36,000张编辑图像。为了提供面向人类的多源图像编辑反馈,该团队还开发了MIEScore,一个基于多模态大型语言模型的评估模型。
-
AI 图像生成器测试系列一致性,而非仅单次输出
最近一次于 7 月 21 日进行的测试,通过将相同的八步编辑提示应用于初始图像,评估了 GPT Image 2、Muse 和 Nano Banana 2。评估的重点不在于宣布获胜者,而在于建立一种严谨的测试方法。这种方法包括一项 27 点的评估,并发布所有生成的输出,以确保一致性和可靠性,特别是对于需要一系列图像满足特定标准的面向客户的项目。