GPT Image
PulseAugur coverage of GPT Image — every cluster mentioning GPT Image across labs, papers, and developer communities, ranked by signal.
4 天有情绪数据
GPT Image quality decline reported on Reddit
Multiple users on Reddit's r/OpenAI forum have reported a recent decline in the quality and prompt adherence of OpenAI's image generation model. This suggests a potential performance degradation that warrants further monitoring.
GPT Image may be less effective for specialized dataset generation
A Reddit user seeking to generate consistent multi-view human datasets mentioned GPT Image as a potential candidate but expressed dissatisfaction with current results. This suggests GPT Image may not be optimized for generating highly consistent, multi-angle outputs required for specialized datasets.
GPT Image may struggle with generating consistent multi-view datasets
Despite being considered a dependable option for text-to-image generation, GPT Image may not be suitable for specialized tasks like creating consistent multi-view human datasets. Users seeking this capability expressed dissatisfaction with current results from GPT Image and other models, indicating a gap in current AI image generation for such precise applications.
GPT Image quality concerns emerge on Reddit
Recent user discussions on Reddit indicate a potential decline in the quality and prompt adherence of OpenAI's image generation model, referred to as GPT Image. Users report that the model, previously accurate, is now producing lower-quality results and is less responsive to instructions, suggesting a recent performance degradation.
-
用户训练潜在细化器修复GPT Image伪影
Reddit上的一位用户开发了一个小型潜在细化器模型,旨在解决GPT Image输出中常见的特定伪影,如斑点和网格状纹理。该细化器使用了75张配对图像进行训练,并包含Qwen、FLUX.2和SDXL等各种VAE的配置文件。用户还提供了一个ComfyUI工作流程,将此细化器与SeedVR2集成,以实现对图像质量的细微而有效的改进,旨在在清理纹理和重建细节的同时保留原始构图。
-
AI 用户详解使用 MiniMax H3 和 Turbo-Lora 创建场景
一位 Reddit 用户分享了他们使用 AI 工具创建短脚本场景的过程,详细介绍了从角色参考表到最终视频生成的步骤。他们使用了 Krea 2 来创建角色表,GPT Image 来进行故事板绘制,并使用 MiniMax H3 配合 Turbo-Lora ref2va 进行视频生成。用户遇到了广角镜头影响面部质量、故事板生成中角色融合问题,并发现偏离中心的镜头角度可以提高唇形同步的准确性。
-
AI 生成的海报需要仔细准备,以避免丢失关键元素
本文讨论了仔细准备 AI 生成的海报以供打印的重要性,即使在使用“Kandinsky”神经网络等高级工具时也是如此。它强调,如果文本或重要对象等关键元素在修剪过程中被切掉,仅靠视觉吸引力是不够的。作者建议采用结构化方法,包括固定海报格式、标记安全区域、列出基本元素以及在控制尺寸下验证其可见性,以降低风险并确保所有关键组件都得到保留。
-
OpenAI 潜在的新 GPT-Image 模型 'Mona-lisa-1' 在 Arena 上现身
一个来自 OpenAI 的潜在新图像生成模型,暂定名为“Mona-lisa-1”,可能被称为“GPT-Image”,已在 Arena 平台上被发现。AiBattle 在 X 上分享了这一发现,表明 OpenAI 的多模态能力可能有所进步。
-
新研究着手解决AI生成视觉故事中的仇恨内容问题
研究人员开发了一种检测AI生成视觉故事中仇恨内容的新方法,这类故事可以由Gemini和GPT Image等先进的文本到图像模型轻松生成。该研究引入了HatefulStoryPrompts,一个包含55个仇恨故事的330个多轮配置的数据集,并评估了五个领先模型,发现它们完成了超过80%的这些故事。现有的审核系统难以处理群体层面的仇恨含义,召回率很低。该研究提出了新的防御措施,包括一个交互感知监控器和生成后分析,以应对视觉叙事中状态化推理…
-
OpenAI 弃用 DALL-E 3 API,敦促迁移至 GPT Image API
OpenAI 已将其 DALL-E 3 API 标记为已弃用,并指示用户使用新的 GPT Image API。此更改不仅仅是简单的名称更新,因为它会引入有关生产环境数据保留策略和响应合同的潜在风险。建议开发人员在迁移任何实时流量之前,彻底测试 GPT Image API 的各个端点、数据处理和输出格式,以确保合规性和功能性。
-
Wildberries对卖家处以最高5万卢布的罚款,因其使用AI生成的图像
2026年上半年,Wildberries显著增加了对卖家账户的封禁数量,超过5000个账户被暂停。该电商平台还因侵犯版权而对每张图像处以最高5万卢布的罚款,特别是涉及AI生成的视觉内容。尽管卖家感到担忧,法院已裁定处罚是针对使用未经授权的内容,而非生成过程本身。卖家可以利用AI图像生成工具来降低成本,前提是他们能够验证原创性和人类的创造性输入。
-
Sber 的 GigaChat 推出免费无限制的 Kandinsky 6.0 AI 图像生成功能
Sber 已将其 Kandinsky 6.0 图像生成模型集成到其 GigaChat AI 助手,提供免费且无限制的图像创作。此举于 2026 年 4 月 28 日宣布,使得先进的 AI 艺术生成无需 VPN、外国支付方式或订阅费即可使用。Netology 于 2026 年 7 月进行的独立测试证实了该模型的免费和无限特性,并将其与其他施加生成限制或水印的服务进行了对比。
-
OpenAI 的 GPT Image 工具助力建筑师完成设计任务
据报道,OpenAI 的 GPT Image 工具正在简化建筑师的任务。该工具似乎有助于生成建筑设计或可视化效果,可能简化该领域的创意和规划流程。这一发展表明人工智能在专业领域的应用日益广泛。
-
OpenAI的图像生成模型面临用户对其质量下降的抱怨
Reddit的r/OpenAI论坛上的用户正在讨论OpenAI的图像生成能力最近感知到的质量和提示遵循度下降。几位用户指出,之前能准确遵循提示的图像生成模型,现在似乎产生的质量较低,并且对用户指令的响应性较差。这一观察表明该模型在过去一周内性能可能有所下降。
-
Reddit用户推测闭源AI模型规模及潜在泄露
Reddit上的一场讨论推测了闭源AI模型的参数数量,包括像"banana pro"和"nano banana 2"这样的假设模型。对话还触及了这些模型未来被泄露的可能性,以及它们是否能在消费级硬件上运行。一位用户指出,当被问及推测性模型大小时,Gemini提供了不准确的参数估算。
-
2026年AI图像生成器:模型选择胜过界面
2026年,选择AI图像生成器将取决于底层模型,而非用户界面。Nano Banana 2因其在进行干净编辑时的速度和效率而受到关注,而GPT Image则被推荐为从文本提示生成图像最可靠的选择。这两种工具都可以在线免费使用,建议的工作流程是从简洁的提示生成多个变体,然后优化最有希望的结果。
-
Reddit 讨论使用 AI 模型生成多视角人体数据集
Reddit r/StableDiffusion 版块的一位用户正在询问使用 AI 模型生成多视角人体数据集的可行性。他们正在寻找能够从不同角度持续渲染单个人物主体而帧之间没有移动的模型,类似于多摄像头捕捉设备。用户特别提到了 Stable Diffusion、Qwen Image 和 GPT Image 作为潜在候选者,但对当前结果表示不满意,并寻求能够实现这种专业数据集生成的模型或技术的建议。
-
Reddit用户寻求论文以复制NanoBanana和GPT-Image的功能
r/StableDiffusion subreddit上的一位Reddit用户正在寻求研究论文的推荐,这些论文可能有助于复制NanoBanana和GPT-Image的功能。该用户特别对这些模型的编辑功能和理解方面感兴趣,并以SCOPE为例说明了其期望的研究方向。
-
Ideogram 4 图像模型被誉为被低估的开源替代品
一位Reddit用户认为,开源图像生成模型Ideogram 4被严重低估,其表现可与NB或GPT Image等闭源替代品相媲美。用户强调,即使是初始版本,在没有社区优化或微调的情况下,其质量也令人印象深刻。他们还回应了关于其安全过滤器、生成时间和JSON提示使用的担忧,并声称这些方面是可控的,并提供了更大的控制权。
-
InvokeAI 6.13.0 添加 Qwen、Gemini 和 Anima 模型支持
InvokeAI 发布了 6.13.0 版本,引入了对包括 Qwen Image、Qwen Edit、Anima、GPT Image、Gemini (nano banana)、SeeDream 和 Wan 在内的多个新 AI 图像生成模型的支持。此次更新还通过新的套索工具和形状调色板,为 Canvas 功能带来了显著的可用性增强。此外,InvokeAI 现在提供共享和私有画廊以支持多用户工作流,改进了工作流节点组织,并推出了新的节点包…
-
InvokeAI 6.13 发布:社区驱动的更新增加了新模型和功能
InvokeAI 发布了 6.13 版本,这是在原商业实体停止运营后,完全由社区驱动的重大更新。此次发布引入了对 Anima 和 Qwen Image 模型的全面支持,以及对 GPT Image 等服务的 API 模型集成。新功能还包括提示扩展功能、图像到提示转换、增强的画布工具(如套索和多边形选择)以及扩展的多用户模式。
-
北京大学的Imagine2Act使机器人能够“先想象,再行动”以完成家务任务
北京大学的研究人员开发了Imagine2Act,这是一个新颖的框架,使机器人能够高精度地执行复杂的家务任务。该系统首先通过生成语义上和几何上对齐的目标点云来“想象”期望的结果,然后使用双重对齐机制来预测精确的机器人动作。这种方法有效地解决了当前方法的局限性,例如生成模型的几何推理能力差和误差累积问题。
-
15人中国团队打造AI图像生成黑马
一个由15人组成的团队开发了一个新的人工智能图像生成模型,将其定位为除Banana和GPT图像之外的第三种选择。该模型能够在短短40小时内完成一年的广告工作量,凸显了其效率。
-
提示工程项目激增,聚焦AI编码代理和图像生成
本周的提示工程领域显示,围绕AI编码助手和多模态提示技术的存储库兴趣显著增加。开发者们正积极探索专注于优化特定模型(如Claude和GPT Image)提示的存储库,并研究提示注入方法。这一趋势凸显了开发者日益增长的对优化AI交互以增强功能的关注。