OpenAI 的 GPT Image 2 模型在渲染文本方面展现出强大的能力,包括高精度的西里尔字母。然而,在生成的多张图像中保持字符一致性仍然是一个挑战,当字符被转移到新的聊天会话时,一致性会下降到 80-85%。OpenAI 建议使用“字符锚定”技术,即为每个新场景提供详细的描述和锚定图像,并附带“不要重新设计角色”的指令,以应对这种不一致性。该模型在输出分辨率和生成速度方面也存在技术限制,更高分辨率被标记为实验性,生成速度因访问级别而异。 AI
影响 为图像生成中的文本渲染设定了新标准,但需要特定的提示技术来实现一致的角色生成。
排序理由 前沿实验室发布的新模型,包含能力和限制的详细信息。[lever_c_demoted from frontier_release: ic=1 ai=1.0]
AI 生成摘要 · Google Gemini · 来自 1 个来源。 我们如何撰写摘要 →