Google · model directory
Nano Banana 是什么?Google 的图像编辑模型解析
Nano Banana 是 Google 的 Gemini 图像模型的昵称,面向对话式编辑,在多次修改中保持主体一致。
Nano Banana at a glance
- 制作者
- 系列
- Gemini
- 访问方式
- Gemini app 和 API
- 以…闻名
- 角色/人物一致性编辑
- 权重
- 闭源
- 交互方式
- 对话式
这个名字从哪儿来
它一开始并不是产品名。一个未标注的模型曾出现在公开的对比评测平台上,人们在不知道来源的情况下对比匿名输出,它以“nano banana”这个占位名参赛。它赢了很多,大家注意到了它,关于“是谁做的”的猜测持续了几周,直到 Google 证实。
随后 Google 破例保留了这个外号,于是一个严肃的基础设施在公众面前却以一个玩笑式称呼为人所知。正式身份是 Gemini 系列的图像模型,但大家搜索用的却是“banana”。
这个来历值得一提,因为它解释了搜索里的反常行为。关注先于营销出现,所以大家问的都是关于传闻的问题——是什么、谁做的、真的假的——而不是常见的产品问题。
它到底有什么不一样
大多数图像模型的中心任务是“根据描述生成图片”。Nano Banana 的中心是“修改你已有的图”,而难点在于守住“你没让它改的东西”。
让一个通用模型把照片里的人换成红色外套,往往会得到一个穿红外套的人,但不是完全同一个人——下颌略不同、眼距略不同,看起来像兄弟姐妹。身份在一次编辑后还能保留,连做几次就会漂移。Nano Banana 的设计目标就是在一连串指令中尽量稳住这种“身份一致性”。
交互方式也随之改变。你不是写一条巨长的 prompt 然后一锤定音,而是通过一轮一轮的对话去微调上一次的结果。把光移过来。现在改成傍晚。再把他放到室外。这个循环本身就是产品。
实际擅长做什么
凡是需要同一主体反复出现的工作。比如一个商品在多种场景下的产品图;一个角色贯穿多格分镜;同一人像的一组变体;同一间房的四种配色 mock-up。
它对不想学 prompt 语法的人也更友好。因为这里的指令是“编辑”而不是“从零规格化描述”,自然语言就能工作,而含糊请求的失败模式只是“小幅改动”,而不是完全跑偏的图片。
不太合适的是“白纸起步”的场景。当没有源图、也没有需要保留的主体时,一致性这套机制无用武之地,而为文生图构图、镜头与风格而生的模型,往往能在起步阶段给你更强的控制。
和替代方案的关系
和 Midjourney 相比,分野在“审美主导权”。Midjourney 有鲜明的家族风格,通常用来做“很有张力”的东西;Nano Banana 则尽量只改你要求的部分,其他保持原样。一个像造型师,一个像修图师。
和开源模型——Stable Diffusion 与 FLUX——相比,分野在“控制权在哪儿”。开源权重让大家可以叠加 ControlNet、LoRA 和 inpainting 流程,精细到像素地控,代价是自己拼装流水线。Nano Banana 把更窄的一部分控制放到一句话后面,更快上手,也更难越权。
和 gpt-image-1 相比,这两者彼此更像:都是闭源、遵循指令、以对话驱动,并挂在一个大型助手上。多数人报告的实际差别在于谁能在多轮编辑里更稳住一张脸,这点最好用你自己的素材测试,而不是只看榜单。
这和 LaFoto 有什么关系
商业上没有——我们与 Google 无关,也不转售其模型。写这页是因为大家会问这是什么,而诚实的答案很短;只写我们“恰好喜欢”的模型,称不上目录。
这页也值得和本站的编辑类页面一起读,因为词汇是互通的。Nano Banana 用对话做的事,开源生态用具名术语来做:inpainting 是在蒙版内改,outpainting 是越框改,denoise 强度决定结果能离源图多远。掌握这些词,能更清楚地看懂任何编辑器在做和没做什么。
编辑与生成
它要解决的核心问题
让通用图像模型改动人物照片里的一个细节,往往会换回一个“差不多”的人:下颌线变了,眼位不对,整张脸更像亲戚而不是同一个人。一次改动还能撑住;连着改四次就不行了。
在你要求的一切都变化的同时,把身份特征保持不变,这是一个很具体的工程问题,也是这个模型直指的目标。正因为这种专注,我们把它称作“编辑器”而不是“生成器”,尽管它两者都能做。

三个真实的用例
当跨图一致性是硬性要求
同一物体,六种环境
把只拍过一次的产品,放到厨房台面、咖啡馆桌面、室外长椅和影棚背景里,全程都能一眼看出还是同一件。
让生成器“再来同一产品”六次,通常会得到六个相似但不同的产品。这点差异,就是编辑模型在商业上的全部论据。
- 一次拍摄,多处投放。
- 物体必须在换景后仍然“是它”。
- 每张输出都要核对标签和 logo。

必须前后连贯的序列创作
漫画、分镜、讲解序列、儿童绘本常常败在同一处:到第五格角色就变样了。
开源生态里的常见做法是训练一个 LoRA。对话式编辑无需训练也能到达相近的位置,代价是可控性没那么精细。
- 不需要训练步骤。
- 长序列中仍会逐步漂移。
- 定期用原图重置锚点。

从现有图片延展出选项
把同一张人像带到多种布光、背景或服装方案里,让客户挑选,而不必再约影棚。
要诚实地说:这些版本都不是“被拍到的东西”。它们是合理的替代方案——拿来做情绪板可以,拿来做存档记录不行。
- 探索阶段比补拍更快。
- 不能替代真实拍摄。
- 切勿用于身份证件。

Nano Banana 常见问题
第一轮体验后大家会问什么
新鲜劲过去之后浮现的问题。
为什么脸最终还是会漂?
每次编辑都是基于上一次结果而不是基于原图,所以小误差会累积。每隔几轮重新提供一次源图,可以重置参照,阻止缓慢滑坡。
能否两次得到完全相同的结果?
不可靠。对话式编辑不像开源流水线那样暴露 seed;这是为了换取这种简单界面所做的一般性取舍。
它比 inpainting 更好吗?
更容易上手。用明确遮罩做 inpainting 可以精确控制哪些像素可变;一句话则把这个判断交给模型。精细工作仍然更适合用遮罩。
能否同时参考多张图?
合并多张参考是常见诉求,但不同界面和版本的支持度不一。别只听第三方描述,拿自己的素材实际测试。
它不擅长什么?
从无到有。没有源图时,一致性机制无从发挥;而为文生图构图打造的模型在取景和光学控制上会给你更多主导权。
对非人类主体也有效吗?
是的,而且往往更稳——产品或建筑可被细究的面部级特征更少。

继续探索
在 LaFoto 的其它位置
编辑只是其中一类工作。其他在这里。
Nano Banana — questions people ask
- 什么是 Nano Banana?
- 这是 Google 的 Gemini 图像生成与编辑模型的昵称,现已被官方采用。它面向对话式编辑,能在连续多次修改中保持主体一致。
- 谁做了 Nano Banana?
- Google。它属于 Gemini 系列。
- 为什么叫 Nano Banana?
- 它曾以这个占位名匿名出现在公开的模型对比平台,表现抢眼,名字被记住。Google 选择顺水推舟而不是更名。
- Nano Banana 是开源的吗?
- 不是。权重是闭源的,通过 Google 的 app 和 API 访问。
- Nano Banana 最擅长什么?
- 在编辑现有图片时保持主体可辨识——比如同一张脸在多轮修改后仍然是同一个人,而多数图像模型在一两次后就会丢失。
- Nano Banana 比 Midjourney 更好吗?
- 定位不同。Midjourney 强审美风格,擅长从零做出夺目的图;Nano Banana 力求只改你要求的部分,尽量不动实拍照片的其余内容。
- Nano Banana 能只凭文字生成图片吗?
- 能,但那不是它的优势。它的长处是“在编辑中保留主体”,这需要一张可供保留的源图。
- LaFoto 会用 Nano Banana 吗?
- 不会,我们与 Google 没有任何关联。这页只是我们模型目录里的参考资料。
今天就开始创作
用最佳 AI 图像生成器生成你的第一张图。
用一句话在数秒内生成成片、逼真的图像——随后精修每个细节。无需配置、无需 Discord、无需 GPU。
加入 4,200+ 位创作者正在使用 LaFoto