Google · model directory
¿Qué es Nano Banana? El modelo de edición de imágenes de Google, explicado
Nano Banana es el apodo del modelo de imágenes de Gemini de Google, creado para una edición conversacional que mantiene al sujeto coherente a lo largo de los cambios.
Nano Banana at a glance
- Creador
- Familia
- Gemini
- Acceso
- Aplicación Gemini y API
- Conocido por
- Edición consistente de personajes
- Pesos
- Cerrados
- Interfaz
- Conversacional
De dónde viene el nombre
No era un nombre de producto. Un modelo sin etiqueta apareció en arenas públicas de evaluación cara a cara, donde la gente compara salidas anónimas sin saber qué sistema las produce, bajo el marcador «nano banana». Ganó mucho, llamó la atención, y las conjeturas sobre quién estaba detrás duraron semanas hasta que Google lo confirmó.
Después Google hizo algo inusual y conservó el apodo, motivo por el que una pieza seria de infraestructura es conocida públicamente por un mote en broma. La identidad formal es un modelo de imagen de Gemini; el nombre que se busca es el del plátano.
Esa historia conviene saberla porque explica por qué el término se comporta de forma tan extraña en las búsquedas. El interés llegó antes que el marketing, así que las preguntas que la gente hace son las que se hacen sobre un rumor —qué es, quién lo hizo, si es real— más que las que se hacen sobre un producto.
Qué hace realmente de forma diferente
La mayoría de modelos de imagen se construyen para generar una imagen a partir de una descripción. Nano Banana se construye para cambiar una imagen que usted ya tiene, y lo difícil ahí es todo lo que usted no pidió cambiar.
Si pide a un modelo generalista que ponga a la persona de esta foto un abrigo rojo, normalmente obtendrá a una persona con abrigo rojo que no es exactamente la misma persona —una mandíbula algo distinta, otro espacio entre los ojos, una cara que parece de un hermano. La identidad sobrevive a una edición y se degrada tras varias. Lo que Nano Banana está diseñado para preservar es esa identidad, a lo largo de una secuencia de instrucciones sucesivas.
De ahí se deriva el modelo de interacción. Usted no escribe un prompt elaborado y acepta lo que vuelva; mantiene una conversación en la que cada turno ajusta el resultado anterior. Mueva la luz. Ahora hágalo de tarde. Ahora póngalo en exterior. Ese bucle es el producto.
Para qué sirve en la práctica
Para cualquier caso en el que el mismo sujeto deba aparecer más de una vez. Fotografía de producto en varios escenarios, un personaje a lo largo de una secuencia de viñetas, un conjunto de variaciones de un mismo retrato, un mockup que deba mostrar una habitación en cuatro gamas de color.
También es inusualmente indulgente con quien no quiere aprender sintaxis de prompt. Como la instrucción es una edición y no una especificación, sirven frases corrientes, y el modo de fallo de una petición vaga es un cambio pequeño en lugar de una imagen irreconocible.
Donde encaja peor es en la página en blanco. Cuando no hay imagen de origen ni sujeto que preservar, la maquinaria de consistencia no tiene nada que hacer, y los modelos pensados para composición texto-a-imagen suelen darle más control sobre encuadre, óptica y estilo desde cero.
Cómo se sitúa frente a las alternativas
Frente a Midjourney, la división es la autoría estética. Midjourney aplica un marcado estilo propio y se usa en general para crear algo llamativo; Nano Banana intenta dejar la imagen intacta salvo donde usted pidió. Uno es un estilista; el otro, un retocador.
Frente a los modelos abiertos —Stable Diffusion y FLUX—, la diferencia está en dónde reside el control. Con pesos abiertos, la gente puede acoplar ControlNet, LoRA y canalizaciones de inpainting para lograr control preciso a costa de montar la cadena. Nano Banana coloca una porción más estrecha de ese control detrás de una frase, más rápido de alcanzar y más difícil de sobrepasar.
Frente a gpt-image-1, ambos están más cerca entre sí que de cualquier otra cosa: modelos cerrados, que siguen instrucciones y se manejan conversacionalmente, unidos a un asistente grande. La diferencia práctica que más se reporta es cuál mantiene mejor un rostro a lo largo de varios turnos, y eso conviene probarlo con su propio material en lugar de tomarlo de una clasificación.
Qué tiene que ver esto con LaFoto
Nada comercial — no tenemos afiliación con Google ni revendemos sus modelos. Esta página existe porque la gente pregunta qué es esto y la respuesta honesta es breve, y un directorio que solo describiera los modelos que nos gustan no sería un directorio.
Conviene leerla junto a las páginas de edición de aquí, porque el vocabulario se traslada. Lo que Nano Banana hace de forma conversacional, el ecosistema abierto lo hace con técnicas nombradas: inpainting para un cambio dentro de una máscara, outpainting para un cambio más allá del encuadre, denoise strength para cuánto se permite desviarse del origen. Conocer esas palabras aclara mucho qué hace y qué no hace cualquier editor.
Edición frente a generación
El problema para el que se construyó
Si pide a un modelo de imagen generalista que cambie una cosa en la foto de una persona, lo habitual es que devuelva a alguien casi igual. La mandíbula se ha movido, los ojos no caen igual, la cara se lee como un pariente y no como la misma persona. Una edición la aguanta; cuatro seguidas ya no.
Mantener la identidad constante mientras cambia todo lo que ha pedido es un problema de ingeniería concreto, y justo ahí apunta este modelo. Por eso se describe como editor y no como generador, aunque pueda hacer ambas cosas.

Tres usos reales
Cuando la consistencia entre imágenes es lo que importa
El mismo objeto en seis entornos
Un producto fotografiado una sola vez y luego situado en una encimera de cocina, una mesa de cafetería, un banco exterior y un fondo de estudio, manteniéndose claramente como el mismo objeto en todos los casos.
Si pide a un generador el mismo producto seis veces, devolverá seis productos parecidos. Esa diferencia es todo el argumento comercial de un modelo de edición.
- Dispare una vez, coloque muchas.
- El objeto debe sobrevivir al cambio de escena.
- Compruebe la etiqueta y el logotipo en cada salida.

Trabajo secuencial que debe cuadrar
Cómics, storyboards, secuencias explicativas y libros infantiles tropiezan en lo mismo: el personaje deja de ser el personaje en el fotograma cinco.
En el ecosistema abierto esto se resuelve entrenando una LoRA. Un editor conversacional llega a un lugar similar sin entrenar nada, a costa de un control menos preciso.
- Sin fase de entrenamiento.
- La deriva se acumula en tiradas largas.
- Vuelva a anclar periódicamente a la imagen original.

Opciones a partir de una foto que ya tiene
Un retrato llevado a varios esquemas de iluminación, fondos o vestuarios para que un cliente elija sin volver a reservar el estudio.
El límite honesto es que ninguna de las variantes es una fotografía de nada. Son alternativas plausibles, útiles para un moodboard y no válidas como registro.
- Más rápido que repetir la sesión para explorar.
- No sustituye a una sesión real.
- Nunca para documentos de identidad.

Preguntas sobre Nano Banana
Lo que se pregunta tras la primera sesión
Lo que surge cuando se pasa la novedad.
¿Por qué la cara sigue derivando al final?
Cada edición se condiciona por el resultado anterior y no por el original, así que los pequeños errores se acumulan. Reaportar la imagen de origen cada pocas vueltas restablece la referencia y detiene el deslizamiento.
¿Puedo obtener el mismo resultado dos veces?
No de forma fiable. La edición conversacional no expone un seed como lo hace un flujo abierto, que es el intercambio general por tener una interfaz así de sencilla.
¿Es mejor que el inpainting?
Es más fácil. Hacer inpainting con una máscara explícita le da control exacto sobre qué píxeles pueden cambiar; una frase delega ese juicio en el modelo. El trabajo de precisión sigue pidiendo máscara.
¿Puede trabajar con más de una imagen de referencia?
Combinar referencias es una petición común y el soporte varía según interfaz y versión. Pruébelo con su propio material en lugar de fiarse de descripciones de terceros.
¿En qué es malo?
En partir de la nada. Sin imagen fuente, el mecanismo de consistencia no tiene nada que preservar, y los modelos pensados para composición de texto a imagen dan más control sobre encuadre y óptica.
¿Funciona con sujetos no humanos?
Sí, y a menudo con más fiabilidad: un producto o un edificio tienen menos rasgos que el espectador escruta que una cara.

Las mismas ideas, con nombre
El vocabulario de la edición conversacional
Siga explorando
En otros lugares de LaFoto
Editar es un trabajo. Estos son los demás.
- redimensionador de imágenes gratuito
- JPG, PNG y WebP
- compresor de imágenes
- recorte una imagen
- paleta de colores de la imagen
- elimine un fondo
- compruebe los datos EXIF
- estructure un prompt
- generador de anime con IA
- convertir una foto en dibujo animado
- generador de pixel art
- los mejores generadores de imágenes con IA
- LaFoto vs Midjourney
- alternativa a Leonardo AI
- comparada con Ideogram
- LaFoto vs Canva
- reproducir una imagen
- qué es la intensidad de denoise
- inpainting explicado
- guías y artículos explicativos
Nano Banana — questions people ask
- ¿Qué es Nano Banana?
- Es el apodo, ahora usado oficialmente, para el modelo de generación y edición de imágenes de Gemini de Google. Está diseñado para una edición conversacional que mantiene un sujeto consistente a lo largo de cambios sucesivos.
- ¿Quién hizo Nano Banana?
- Google. Forma parte de la familia Gemini.
- ¿Por qué se llama Nano Banana?
- Apareció de forma anónima en arenas públicas de comparación de modelos bajo ese nombre provisional, tuvo un rendimiento llamativo y la etiqueta se consolidó. Google la adoptó en lugar de combatirla.
- ¿Nano Banana es de código abierto?
- No. Los pesos son cerrados y el acceso es a través de la aplicación y la API de Google.
- ¿En qué es mejor Nano Banana?
- En editar una imagen existente manteniendo el sujeto reconocible —el mismo rostro a lo largo de varios cambios sucesivos, que la mayoría de modelos de imagen pierden tras una o dos ediciones.
- ¿Nano Banana es mejor que Midjourney?
- Hacen trabajos distintos. Midjourney impone una estética marcada y se usa para crear imágenes impactantes desde cero; Nano Banana intenta cambiar solo lo que usted pidió y dejar intacto el resto de una fotografía real.
- ¿Nano Banana puede generar imágenes solo desde texto?
- Sí, pero no es ahí donde destaca. Su capacidad diferencial es preservar un sujeto a través de ediciones, lo que requiere una imagen de origen que preservar.
- ¿LaFoto usa Nano Banana?
- No, y no tenemos ninguna afiliación con Google. Esta página es material de referencia en nuestro directorio de modelos.
Los otros modelos del directorio
Empiece a crear hoy
Genere su primera imagen con el mejor generador de imágenes con IA.
Convierta una frase en una imagen terminada y fotorrealista en segundos — y luego afine cada detalle. Sin configuración, sin Discord, sin GPU.
Únase a 4200+ creadores que usan LaFoto