跳到正文
LaFoto

Google · model directory

Nano Banana 是什么?Google 的图像编辑模型解析

Nano Banana 是 Google 的 Gemini 图像模型的昵称,面向对话式编辑,在多次修改中保持主体一致。

Nano Banana 是 Google 的 Gemini 图像生成与编辑模型的昵称。它的核心特征是对话式编辑:你提供一张图,用自然语言描述想改的地方,它只改你要求的部分,同时尽量保持其它内容——尤其是人脸——在视觉上仍是同一个人。这个名字最初来自社区的称呼,之后被 Google 采纳为官方用法。

Nano Banana at a glance

制作者
Google
系列
Gemini
访问方式
Gemini app 和 API
以…闻名
角色/人物一致性编辑
权重
闭源
交互方式
对话式

这个名字从哪儿来

它一开始并不是产品名。一个未标注的模型曾出现在公开的对比评测平台上,人们在不知道来源的情况下对比匿名输出,它以“nano banana”这个占位名参赛。它赢了很多,大家注意到了它,关于“是谁做的”的猜测持续了几周,直到 Google 证实。

随后 Google 破例保留了这个外号,于是一个严肃的基础设施在公众面前却以一个玩笑式称呼为人所知。正式身份是 Gemini 系列的图像模型,但大家搜索用的却是“banana”。

这个来历值得一提,因为它解释了搜索里的反常行为。关注先于营销出现,所以大家问的都是关于传闻的问题——是什么、谁做的、真的假的——而不是常见的产品问题。

它到底有什么不一样

大多数图像模型的中心任务是“根据描述生成图片”。Nano Banana 的中心是“修改你已有的图”,而难点在于守住“你没让它改的东西”。

让一个通用模型把照片里的人换成红色外套,往往会得到一个穿红外套的人,但不是完全同一个人——下颌略不同、眼距略不同,看起来像兄弟姐妹。身份在一次编辑后还能保留,连做几次就会漂移。Nano Banana 的设计目标就是在一连串指令中尽量稳住这种“身份一致性”。

交互方式也随之改变。你不是写一条巨长的 prompt 然后一锤定音,而是通过一轮一轮的对话去微调上一次的结果。把光移过来。现在改成傍晚。再把他放到室外。这个循环本身就是产品。

实际擅长做什么

凡是需要同一主体反复出现的工作。比如一个商品在多种场景下的产品图;一个角色贯穿多格分镜;同一人像的一组变体;同一间房的四种配色 mock-up。

它对不想学 prompt 语法的人也更友好。因为这里的指令是“编辑”而不是“从零规格化描述”,自然语言就能工作,而含糊请求的失败模式只是“小幅改动”,而不是完全跑偏的图片。

不太合适的是“白纸起步”的场景。当没有源图、也没有需要保留的主体时,一致性这套机制无用武之地,而为文生图构图、镜头与风格而生的模型,往往能在起步阶段给你更强的控制。

和替代方案的关系

Midjourney 相比,分野在“审美主导权”。Midjourney 有鲜明的家族风格,通常用来做“很有张力”的东西;Nano Banana 则尽量只改你要求的部分,其他保持原样。一个像造型师,一个像修图师。

和开源模型——Stable Diffusion 与 FLUX——相比,分野在“控制权在哪儿”。开源权重让大家可以叠加 ControlNet、LoRA 和 inpainting 流程,精细到像素地控,代价是自己拼装流水线。Nano Banana 把更窄的一部分控制放到一句话后面,更快上手,也更难越权。

和 gpt-image-1 相比,这两者彼此更像:都是闭源、遵循指令、以对话驱动,并挂在一个大型助手上。多数人报告的实际差别在于谁能在多轮编辑里更稳住一张脸,这点最好用你自己的素材测试,而不是只看榜单。

这和 LaFoto 有什么关系

商业上没有——我们与 Google 无关,也不转售其模型。写这页是因为大家会问这是什么,而诚实的答案很短;只写我们“恰好喜欢”的模型,称不上目录。

这页也值得和本站的编辑类页面一起读,因为词汇是互通的。Nano Banana 用对话做的事,开源生态用具名术语来做:inpainting 是在蒙版内改,outpainting 是越框改,denoise 强度决定结果能离源图多远。掌握这些词,能更清楚地看懂任何编辑器在做和没做什么。

编辑与生成

它要解决的核心问题

让通用图像模型改动人物照片里的一个细节,往往会换回一个“差不多”的人:下颌线变了,眼位不对,整张脸更像亲戚而不是同一个人。一次改动还能撑住;连着改四次就不行了。

在你要求的一切都变化的同时,把身份特征保持不变,这是一个很具体的工程问题,也是这个模型直指的目标。正因为这种专注,我们把它称作“编辑器”而不是“生成器”,尽管它两者都能做。

同一张人像照片打印四份,每张采用不同光线

三个真实的用例

当跨图一致性是硬性要求

同一物体,六种环境

把只拍过一次的产品,放到厨房台面、咖啡馆桌面、室外长椅和影棚背景里,全程都能一眼看出还是同一件。

让生成器“再来同一产品”六次,通常会得到六个相似但不同的产品。这点差异,就是编辑模型在商业上的全部论据。

  • 一次拍摄,多处投放。
  • 物体必须在换景后仍然“是它”。
  • 每张输出都要核对标签和 logo。
AI 编辑的产品场景,替换背景

Nano Banana 常见问题

第一轮体验后大家会问什么

新鲜劲过去之后浮现的问题。

为什么脸最终还是会漂?

每次编辑都是基于上一次结果而不是基于原图,所以小误差会累积。每隔几轮重新提供一次源图,可以重置参照,阻止缓慢滑坡。

能否两次得到完全相同的结果?

不可靠。对话式编辑不像开源流水线那样暴露 seed;这是为了换取这种简单界面所做的一般性取舍。

它比 inpainting 更好吗?

更容易上手。用明确遮罩做 inpainting 可以精确控制哪些像素可变;一句话则把这个判断交给模型。精细工作仍然更适合用遮罩。

能否同时参考多张图?

合并多张参考是常见诉求,但不同界面和版本的支持度不一。别只听第三方描述,拿自己的素材实际测试。

它不擅长什么?

从无到有。没有源图时,一致性机制无从发挥;而为文生图构图打造的模型在取景和光学控制上会给你更多主导权。

对非人类主体也有效吗?

是的,而且往往更稳——产品或建筑可被细究的面部级特征更少。

AI 生成的棚拍人像,配以柔和包裹光

继续探索

在 LaFoto 的其它位置

编辑只是其中一类工作。其他在这里。

Nano Banana — questions people ask

什么是 Nano Banana?
这是 Google 的 Gemini 图像生成与编辑模型的昵称,现已被官方采用。它面向对话式编辑,能在连续多次修改中保持主体一致。
谁做了 Nano Banana?
Google。它属于 Gemini 系列。
为什么叫 Nano Banana?
它曾以这个占位名匿名出现在公开的模型对比平台,表现抢眼,名字被记住。Google 选择顺水推舟而不是更名。
Nano Banana 是开源的吗?
不是。权重是闭源的,通过 Google 的 app 和 API 访问。
Nano Banana 最擅长什么?
在编辑现有图片时保持主体可辨识——比如同一张脸在多轮修改后仍然是同一个人,而多数图像模型在一两次后就会丢失。
Nano Banana 比 Midjourney 更好吗?
定位不同。Midjourney 强审美风格,擅长从零做出夺目的图;Nano Banana 力求只改你要求的部分,尽量不动实拍照片的其余内容。
Nano Banana 能只凭文字生成图片吗?
能,但那不是它的优势。它的长处是“在编辑中保留主体”,这需要一张可供保留的源图。
LaFoto 会用 Nano Banana 吗?
不会,我们与 Google 没有任何关联。这页只是我们模型目录里的参考资料。

今天就开始创作

用最佳 AI 图像生成器生成你的第一张图。

用一句话在数秒内生成成片、逼真的图像——随后精修每个细节。无需配置、无需 Discord、无需 GPU。

加入 4,200+ 位创作者正在使用 LaFoto