GPT-Image-1.5
PulseAugur coverage of GPT-Image-1.5 — every cluster mentioning GPT-Image-1.5 across labs, papers, and developer communities, ranked by signal.
1 天有情绪数据
-
Runway ML 的视频模型排名下降;订阅增加了竞争对手
根据 2026 年 7 月的数据,Runway ML 的视频生成模型 Gen-4 和 Gen-4.5 已跌出 Artificial Analysis 排行榜前 20 名。这与其八个月前声称的性能相比,是一个显著的下降,当时 Gen-4.5 据称是全球最佳视频模型。尽管如此,Runway 已将其 Kling 3.0 和 Sora 2 Pro 等第三方模型集成到其订阅服务中,这引发了关于定价以及用户是为 Runway 自身质量下降付费还是…
-
Luma Labs发布新视频模型,在推理能力上超越Google和OpenAI
Luma Labs发布了一个新的视频生成模型luma/uni-1,他们声称该模型在推理基准测试中超越了Google的Nano Banana 2和GPT-Image-1.5。该模型采用了“先推理,后像素”的方法开发,并被用来创作一个受世界杯启发的足球主题视频。这些新模型现已通过AI/ML API提供。
-
没有单一的“最佳”AI模型;特定任务的选择可优化性能和成本
没有单一的“最佳”AI模型,而是有适合不同任务的特定模型。Claude Opus和GPT-5.5在推理密集型工作中表现出色,而GLM-5.2和Grok更适合高容量、重复性任务。还存在用于图像中文本的GPT Image 2和用于透明背景的GPT Image 1.5等专用模型。为每项工作使用合适的模型有助于管理AI积分支出。
-
新的SciForma框架生成科学准确的图表
研究人员推出了一种名为SciForma的新框架,旨在生成具有高结构保真度的科学图表。该框架通过将图表质量分解为三个关键维度:组件、箭头和文本,来解决当前模型的局限性。为了支持这一点,他们策划了一个大型数据集(SciFormaData-700K)和一个逻辑验证的评估基准(SciFormaBench-2K)。SciForma采用了一种新颖的多维度联合偏好优化(M-DPO)技术,以确保所有结构维度的同步正确性,其性能优于现有的开源模型和GP…
-
AI图像模型成本分析包含新模型
一项新的成本分析已发布,评估了33款不同的AI图像模型。该基准包括新添加的模型,如Seedream、Gemini 3.1 Flash Lite Image和GPT-Image-1.5。尽管增加了新模型,但最便宜和最昂贵的选项与之前的发现保持一致。
-
SenseNova 发布更新的图表生成模型 V2
SenseNova-U1-8B-MoT-Infographic-V2,一个更新的图表生成模型已发布。新版本在小文本渲染、复杂布局稳定性和整体视觉质量方面有所改进,并修复了意外黑色背景的问题。基准测试显示,在 BizGenEval 和 IGenBench 等指标上,其性能优于前代模型和其他模型(如 Qwen-Image),但偶尔出现文本模糊的问题仍然存在。
-
视觉提示词利用图像编辑AI安全漏洞,提出新防御方法
研究人员开发了一种新颖的“以视觉为中心的越狱攻击”(VJA),该攻击通过使用视觉提示词而非文本来利用大型图像编辑模型的漏洞。此方法可以绕过Nano Banana Pro和GPT-Image-1.5等模型的安全措施,在生成有害内容方面取得了很高的成功率。为应对此问题,提出了一种基于内省多模态推理的无训练防御机制,该机制在无需额外保护模型或大量计算资源的情况下显著提高了模型安全性。
-
用户发现旧版OpenAI图像模型更适合儿童艺术
一位Reddit用户分享了他们比较OpenAI图像生成模型(特别是GPT-Image-1、GPT-Image-1.5和GPT-Image-2)的经验。他们发现,尽管GPT-Image-1存在一些小瑕疵,但其生成的图像最接近他们为儿童卡牌游戏设定的风格。GPT-Image-1.5颜色更亮,但增加了不想要的细节,而GPT-Image-2生成的艺术作品更成熟,但未能满足提示中对可爱、儿童友好美学的要求。用户对需要为偏离最初艺术构想的新模型调…
-
Luma Labs发布Uni-1.1,以一半的价格提供一致的IP生成
Luma Labs发布了Uni-1.1,这是一款新推出的多模态AI模型,能够生成具有一致角色和文本的复杂图像,并执行多轮编辑。该模型旨在简化游戏艺术、动画和虚拟代言等应用的创意工作流程。Luma Labs强调Uni-1.1的成本效益和性能,将其定位为AI图像生成市场中的一个有竞争力的产品。
-
Wan-Image系统统一LLM和扩散模型,实现专业级视觉生成
研究人员推出了Wan-Image,一个统一的视觉生成系统,旨在将图像生成模型从休闲工具提升为专业级生产力应用。该系统集成了大型语言模型和扩散Transformer,以实现对图像创建的精确控制,包括复杂的文本渲染和身份保持。人类评估表明,Wan-Image的表现优于Seedream 5.0 Lite和GPT Image 1.5等模型,标志着其在各行业视觉内容创作方面取得了重大进展。
-
Google AI 推出用于学术图表和同行评审的代理
Google AI 推出了两个旨在增强学术研究工作流程的新代理。PaperVizAgent 通过协调专门的 AI 代理团队,协助研究人员根据手稿文本创建出版质量的图表。ScholarPeer 充当自动化审稿人,严格评估学术论文并提供基于文献的批判性反馈。这些工具旨在减轻科学家的行政负担,使他们能够更专注于创新。
-
OpenAI 的 GPT Image-1.5 声称在基准测试中名列前茅,但未能通过 Vibe Checks
据 Smol AINews 报道,OpenAI 的新 GPT Image-1.5 模型在所有基准测试中的表现均已超越 Nano Banana Pro。然而,该模型据称未能通过定性的“Vibe Checks”,这表明量化性能与用户感知或实际可用性之间可能存在脱节。