Nano Banana Pro
PulseAugur coverage of Nano Banana Pro — every cluster mentioning Nano Banana Pro across labs, papers, and developer communities, ranked by signal.
- developed by Vision Banana 95%
- developed by Google AI 95%
- instance of Nano Banana 2 90%
- developed Nano Banana 2 90%
- developed by Nano Banana 2 90%
- instance of Nano Banana 90%
- used by Gemini Enterprise Agent Platform 90%
- instance of Nano Banana 2 Lite 90%
- developed by Nano Banana 90%
- competes with GPT-Image-1.5 80%
- competes with GPT-Image-2 70%
- used by Nano Banana 70%
- 2026-08-06 product_launch Google has reduced the free usage quotas for its Nano Banana Pro model in the Gemini application. 来源
- 2026-06-27 product_launch Nano Banana Pro, an AI image generation tool, has been highlighted for its realistic output and integration within the Gemini ecosystem. 来源
- 2026-05-22 product_launch Replicate launched the Nano Banana Pro AI image generation model. 来源
10 天有情绪数据
-
AI 模型在像素艺术游戏素材生成方面展开竞争
本文详细介绍了 AI 模型 Nano Banana Pro、Grok 以及定制的 ComfyUI 设置在为一款僵尸生存游戏生成像素艺术素材方面的竞争。该游戏的风格灵感来源于《Dead Ahead》等复古游戏。
-
Google 的 Nano Banana 图像生成模型面临复杂的定价和停产问题
Google Gemini API 针对其 Nano Banana 图像生成模型的定价复杂且可能发生变化,其中 legacy、2、2 Lite 和 Pro 等不同层级提供不同的成本和功能。legacy 模型每张图像定价 0.039 美元,将于 2026 年 10 月停产,届时用户将被转移到更昂贵的 Pro 版本。对于订阅用户而言,定价模式已从简单的每日配额转变为“按计算量使用”的系统,使得确定每张图像的固定成本变得困难。
-
Google Gemini 的图像编辑功能在不同版本中表现不一
Google 的 Gemini 模型在其图像编辑功能方面进行了更新,引入了 Nano Banana Pro,有望提高混合多张图像时的连贯性。然而,早期对 Gemini 2.5 Flash Image 等先前版本的测试结果喜忧参半,一位记者报告称出现“可怕的损坏”,而另一位则发现 Gemini 的编辑准确且专注于请求的更改。Gemini 图像编辑的有效性似乎取决于任务,简单的对象替换比反射或阴影等复杂的物理重建效果更好。建议用户直接测试…
-
AI Raphael 使用 Nano Banana Pro 模型提供免费 AI 图像生成
AI Raphael 是一款允许用户免费生成和编辑图像的新工具。该服务由 Nano Banana Pro 模型驱动,并使用 Next.js 和 Tailwind CSS 构建。
-
Poe AI 削减免费套餐,高端模型成本引发用户担忧
Poe AI 调整了其计算点数系统,在未公开宣布的情况下,将每日免费套餐额度从 3000 点大幅削减至 300 点。该平台提供各种订阅套餐,费用根据所使用的 AI 模型而定,而不仅仅是购买的总点数。虽然 Poe 旨在成为一个模型无关的平台,但像 Claude-Opus-4.5 这样的高级模型重度用户发现,即使是最高级别的订阅套餐,每日使用量也有限,这可能比直接订阅单个模型更昂贵。
-
因需求旺盛,Google 削减 Nano Banana Pro 免费套餐额度
Google 已大幅削减其 Gemini 应用内 Nano Banana Pro 模型的免费使用配额,在未公开宣布的情况下,将每日图片生成次数从三次减少到两次。此次削减归因于出乎意料的高需求和计算资源限制,反映了 Google 最初承诺的广泛免费访问与实际限制之间的差距。虽然 Gemini 应用的限制是动态的且可能发生变化,但据报道 AI Studio 平台提供更慷慨但未公开的用量限制。此外,Nano Banana 模型仅作为云服务提…
-
Google 的 Nano Banana 图像模型因缺乏官方域名而面临仿冒网站的困扰
Nano Banana 并非独立产品,而是集成在 Google Gemini 及其他 Google 服务中的图像生成模型套件。由于缺乏专门的 Nano Banana 网站,导致第三方仿冒网站泛滥,这些网站通过包装公开 API 向用户收费。官方入口可通过 Google Gemini、AI Studio 和 Google API 访问,其中 Nano Banana 2(优化速度)和 Nano Banana Pro(注重事实准确性)等不同模…
-
Kandinsky 5.0 对比 GPT Image 2 和 Nano Banana 2:俄语提示理解力比较
一项文本到图像模型的比较显示,尽管 GPT Image 2 和 Nano Banana 2 在盲人评分的通用图像生成方面处于领先地位,但它们在俄罗斯用户的使用方面存在可访问性问题。Sber AI 开发的 Kandinsky 5.0 因其对俄语提示的原生理解以及包含“俄罗斯文化代码”数据集而受到关注,该数据集有助于生成具有文化特性的图像和可读的西里尔字母文本。然而,由于不同的工程方法,直接比较变得复杂,例如 OpenAI 的提示重写和 …
-
新的MIEScore模型和MIE-Bench数据集推动多源图像编辑评估
研究人员推出了MIEScore,这是一种旨在评估多源图像编辑(MIE)能力的新评估模型,这对于高级图像处理任务至关重要。现有基准在评估MIE方面常常不足,因此创建了MIE-Bench,这是一个包含16个任务的3000个编辑实例的大型数据集。该基准包含超过108,000个视觉质量、指令遵循和属性保持的人工评分。MIEScore是一个多模态大型语言模型,在与MIE任务的人类偏好保持一致方面表现出最先进的性能。
-
Nano Banana Pro 在新的图像空间规则发现基准测试中领先
一个名为 WISRD 的新基准已被开发出来,用于测试图像编辑模型的规则发现能力。该基准包括 11 个核心任务和补充探针,旨在评估空间操纵、模式推理和逻辑推理能力。在评估中,Nano Banana Pro 的表现优于其他模型,在该基准的一个子集上达到了 48.7% 的通过率,显著高于 Qwen Image Edit 和 FLUX.2 Klein 4B。
-
新的MIE-Bench和MIEScore基准评估多源图像编辑
研究人员推出了MIE-Bench,这是一个旨在评估多源图像编辑(MIE)能力的新基准,解决了现有基准主要关注单图像任务的局限性。MIE-Bench包含16个任务的3000个编辑实例,利用了多个源图像和编辑提示,以及来自12个最先进模型和超过108,000个人类评分的36,000张编辑图像。为了提供面向人类的多源图像编辑反馈,该团队还开发了MIEScore,一个基于多模态大型语言模型的评估模型。
-
AI视频创作者使用多模型工作流并附带详细分镜头列表
一位AI视频创作者详细介绍了一种工作流程,该流程利用多个生成模型来处理短片的各个方面,而不是依赖单一的最佳工具。这种方法需要一个详细的分镜头列表,作为路由表,指定每个画面的意图、参考和验收标准。创作者强调,更多的模型并不一定意味着更好的控制,保持一致的视觉风格和提示库对于避免漂移和不必要的成本至关重要。
-
比较用于游戏资产生成的AI模型
本文比较了几种用于生成游戏资产的AI模型,这是基于之前仅使用Nano Banana Pro的实验。目前的比较包括Seedream 5.0、Nano Banana Pro、GPT Image 2、Nano Banana 2、Grok Image和Krea 2。评估使用一致的参考图像和提示语,并且不进行生成后编辑,以确定哪个AI最能理解初始指令。
-
AI图像生成:平衡电子商务包装的真实感和文本准确性
一位Reddit用户正在寻求有关如何改进电子商务包装图像生成的建议,特别是在准确渲染小文本方面遇到困难。他们正在尝试将擅长文本的OpenAI的ChatGPT 2与更擅长真实感和光照但文本细节表现不佳的Nano Banana模型相结合。用户正在寻找利用这两个模型优势的策略,以生成具有清晰文本的一致且逼真的产品图像。
-
Maginary 集成新的 AI 视频和图像模型,简化生成过程
多媒体生成平台 Maginary 已集成两个新模型:用于视频的 Seedance 2.0 和用于图像生成的 GPT-Image-2(也称为 ChatGPT Images 2.0)。该平台旨在通过允许用户使用单个提示生成内容,从而简化 AI 模型的使用,并抽象化选择不同底层模型的复杂性。GPT-Image-2 尤其具有改进的文本渲染能力,而 Seedance 2.0 则提供增强的视频生成功能,支持原生音频和更长的剪辑时长。
-
Moonshot AI 发布 Kimi Agent 及新的 Kimi K3 模型
Moonshot AI 发布了 Kimi Agent,这是一个由其新的 Kimi K3 模型驱动的自主代理,该模型已于 2026 年 7 月 16 日上市。该代理可以规划任务,利用 20 多种工具,并生成各种文件,包括网站、文档和可编辑的演示文稿。Kimi K3 模型拥有 2.8 万亿个参数和 100 万个 token 的上下文窗口,使其成为领先的开放许可模型。
-
Oxygen-TryOn:新型时尚原生模型在虚拟试穿方面表现出色
研究人员推出了 Oxygen-TryOn,这是一款专为各种时尚类别中的虚拟试穿应用设计的新型基础模型。与通用图像编辑器不同,Oxygen-TryOn 利用专用的数据引擎和专门的训练,实现人物穿着各种商品的逼真合成。该模型支持多张参考图像、全身或半身视图以及自由的多商品组合,同时保持人物身份和商品外观。在单商品和多商品虚拟试穿的基准测试中,其性能优于现有的专有和开源系统。
-
AI 视频生成工具 Seedance 2.0 和 2.5 详解
一个 GitHub 仓库详细介绍了一个使用 Seedance 2.0、Nano Banana Pro、Sonilo、ElevenLabs 和 Gemini 等工具组合创建短篇 AI 生成电影的流程。该流程通过几个已完成的电影进行了演示,指导用户完成创建角色肖像、故事板和动画短片等步骤,然后生成视频片段并将其与音乐和声音组合起来。另外,一篇 dev.to 文章讨论了 ByteDance 的 Seedance 2.5,这是于 2026 年…
-
新的TCD-Net框架利用因果干预将图像内容与噪声解耦
研究人员开发了TCD-Net,一个用于图像去噪的新型深度学习框架,该框架在Vision Transformer架构中利用因果干预和解耦。该方法旨在通过显式分离内容和噪声来克服传统模型的局限性,防止虚假关联并保留精细细节。该框架包含一个环境偏差调整模块和一个双分支解耦头,并由Google的Nano Banana Pro模型指导进行因果先验推理。实验表明,TCD-Net在基准测试中取得了卓越的性能和实时处理速度。
-
开源工具简化图像生成的 LoRA 训练
一位开发者创建了一个名为 LoRA Dataset Studio 的开源自托管工具,旨在简化图像生成模型 LoRA 的训练过程。该工具将数据集创建、字幕生成和训练等各个阶段整合到一个用户界面中。它通过自动化图像变体生成、面部相似度评分和自动字幕生成等任务,旨在简化角色、概念和风格 LoRA 的生成,并且可以在没有 GPU 的情况下运行,或在本地使用 ai-toolkit 运行。