Google · model directory
Was ist Nano Banana? Googles Bildbearbeitungsmodell erklärt
Nano Banana ist der Spitzname für Googles Gemini-Bildmodell, entwickelt für konversationelle Bearbeitung, die ein Motiv über Änderungen hinweg konsistent hält.
Nano Banana at a glance
- Hersteller
- Familie
- Gemini
- Zugriff
- Gemini-App und API
- Bekannt für
- Charakterkonsistente Bearbeitung
- Gewichte
- Geschlossen
- Schnittstelle
- Konversationell
Woher der Name stammt
Es war kein Produktname. Ein nicht beschriftetes Modell tauchte in öffentlichen Vergleichsarenen auf, in denen Menschen anonyme Ausgaben ohne Kenntnis des Systems gegenüberstellen, unter dem Platzhalter „nano banana“. Es gewann sehr häufig, fiel auf, und es wurde wochenlang gerätselt, wer dahintersteckt, bis Google es bestätigte.
Google tat dann Ungewöhnliches und behielt den Spitznamen — weshalb ein ernsthaftes Infrastrukturstück öffentlich unter einem scherzhaften Handle läuft. Formal ist es ein Gemini-Bildmodell; gesucht wird aber nach der Banane.
Diese Geschichte ist relevant, weil sie erklärt, warum sich der Begriff in der Suche so eigen verhält. Das Interesse war da, bevor Marketing existierte. Entsprechend lauten die Fragen wie bei einem Gerücht — was ist es, wer hat es gebaut, ist es echt — statt wie bei einem Produkt.
Was es tatsächlich anders macht
Die meisten Bildmodelle sind darauf ausgelegt, ein Bild aus einer Beschreibung zu erzeugen. Nano Banana ist darauf ausgelegt, ein vorhandenes Bild zu verändern — und das Schwierige ist alles, was Sie nicht ändern wollten.
Bitten Sie ein allgemeines Modell, die Person auf diesem Foto in einen roten Mantel zu stecken, bekommen Sie meist eine Person im roten Mantel, die nicht ganz dieselbe Person ist — leicht andere Kieferlinie, anderer Augenabstand, ein Gesicht wie ein Geschwister. Die Identität überlebt eine Bearbeitung und baut sich über mehrere ab. Genau diese Identität über eine Folge von Anweisungen zu halten, ist das Ziel von Nano Banana.
Daraus folgt das Interaktionsmodell. Sie schreiben keinen einen elaborierten prompt und nehmen hin, was zurückkommt; Sie führen ein Gespräch, in dem jede Runde das letzte Ergebnis justiert. Licht versetzen. Jetzt Abendstimmung. Jetzt nach draussen. Diese Schleife ist das Produkt.
Wofür es sich in der Praxis eignet
Alles, bei dem dasselbe Motiv mehrmals auftauchen muss. Produktfotos in mehreren Umgebungen, eine Figur über eine Panel-Sequenz, Varianten eines Porträts, ein Mock-up, das denselben Raum in vier Farbwelten zeigen soll.
Zudem ist es ungewöhnlich fehlertolerant für Menschen, die keine prompt-Syntax lernen möchten. Weil die Anweisung eine Bearbeitung statt einer Spezifikation ist, funktionieren einfache Sätze — und der Fehlermodus einer vagen Bitte ist eine kleine Änderung statt eines unkenntlichen Bildes.
Schwächer passt es zum weissen Blatt. Wo es kein Ausgangsbild und kein zu bewahrendes Motiv gibt, hat die Konsistenz-Mechanik nichts zu tun, und auf Text-zu-Bild spezialisierte Modelle geben Ihnen aus dem Stand mehr Kontrolle über Bildaufbau, Optik und Stil.
Wie es sich gegenüber Alternativen einordnet
Gegenüber Midjourney liegt die Trennlinie bei der ästhetischen Autorschaft. Midjourney legt einen starken Hausstil darüber und wird meist genutzt, um etwas Markantes zu schaffen; Nano Banana versucht, das Bild ausser an den gewünschten Stellen in Ruhe zu lassen. Das eine ist Stylist, das andere Retuscheur.
Gegenüber offenen Modellen — Stable Diffusion und FLUX — liegt die Trennlinie bei der Kontrolle. Offene Gewichte erlauben, ControlNet, LoRAs und inpainting-Pipelines anzuflanschen und so präzise Kontrolle zu erhalten — zum Preis des Pipeline-Aufbaus. Nano Banana legt einen schmaleren Ausschnitt dieser Kontrolle hinter einen Satz, schneller erreichbar und schwerer zu überschreiten.
Gegenüber gpt-image-1 liegen beide näher beieinander als zu allem anderen: geschlossen, anweisungsfolgend, konversationell und an einen Assistenten gekoppelt. Praktisch berichten die meisten als Unterschied, welches Gesicht über mehrere Runden besser gehalten wird — und das sollten Sie an Ihrem eigenen Material testen statt von Leaderboards abzulesen.
Was das mit LaFoto zu tun hat
Geschäftlich nichts — wir sind weder mit Google affiliiert noch vertreiben wir dessen Modelle. Diese Seite existiert, weil Menschen fragen, was das ist, und die ehrliche Antwort kurz ist; ein Verzeichnis, das nur Modelle beschreibt, die wir mögen, wäre kein Verzeichnis.
Lesen Sie das am besten zusammen mit den Bearbeitungsseiten hier, denn die Begriffswelt überträgt sich. Was Nano Banana konversationell tut, leistet das offene Ökosystem mit benannten Techniken: inpainting für Änderungen innerhalb einer Maske, outpainting für Änderungen ausserhalb des Rahmens, denoise-Stärke dafür, wie weit sich ein Ergebnis von der Quelle entfernen darf. Diese Wörter zu kennen, macht klarer, was ein Editor tut und was nicht.
Bearbeiten versus Generieren
Das Problem, für das es gebaut wurde
Bitten Sie ein allgemeines Bildmodell, an einem Foto einer Person nur eine Sache zu ändern, und Sie erhalten meist eine Person zurück, die fast passt. Der Kiefer hat sich verschoben, die Augen sitzen anders, das Gesicht wirkt wie ein Verwandter statt dieselbe Person. Eine einzelne Korrektur übersteht es; vier hintereinander nicht.
Die Identität konstant zu halten, während sich alles Gewünschte ändert, ist ein konkretes Ingenieursproblem — und genau darauf zielt dieses Modell. Darum wird es als Editor beschrieben und nicht als Generator, obwohl es beides kann.

Drei echte Anwendungsfälle
Wenn Konsistenz über mehrere Bilder gefordert ist
Dasselbe Objekt in sechs Umgebungen
Ein Produkt einmal fotografiert, dann auf eine Küchenarbeitsplatte, einen Café-Tisch, eine Parkbank im Freien und einen Studiohintergrund gesetzt — stets eindeutig dasselbe Objekt.
Ein Generator, der sechsmal nach demselben Produkt gefragt wird, liefert sechs ähnliche Produkte. Dieser Unterschied ist das gesamte kaufmännische Argument für ein Bearbeitungsmodell.
- Einmal shooten, vielfach platzieren.
- Das Objekt muss den Szenenwechsel überstehen.
- Etikett und Logo in jedem Output prüfen.

Sequenzielle Arbeit, die zusammenhalten muss
Comics, Storyboards, Erklärsequenzen und Kinderbücher scheitern oft an demselben Punkt: Spätestens im fünften Frame ist die Figur nicht mehr dieselbe.
Im offenen Ökosystem löst man das durch eine trainierte LoRA. Ein dialogischer Editor erreicht Ähnliches ohne Training — mit weniger präziser Kontrolle als Preis.
- Kein Trainingsschritt nötig.
- Über lange Läufe sammelt sich Drift.
- Regelmässig am Originalbild neu verankern.

Optionen aus einem vorhandenen Bild
Ein einziges Porträt in mehrere Lichtsituationen, Hintergründe oder Looks übertragen, damit der Kunde wählen kann — ohne das Studio erneut zu buchen.
Die ehrliche Grenze: Keine Variante ist eine Fotografie von etwas Reellem. Es sind plausible Alternativen — gut für ein Moodboard, nicht gut als Nachweis.
- Schneller als ein Reshoot zur Exploration.
- Kein Ersatz für ein echtes Shooting.
- Nie für Ausweisdokumente.

Nano Banana – Fragen
Was nach der ersten Session aufkommt
Themen, die bleiben, wenn der Neuheitseffekt vorbei ist.
Warum driftet das Gesicht trotzdem irgendwann?
Jede Bearbeitung konditioniert auf das vorherige Ergebnis statt auf das Original. Kleine Fehler summieren sich. Wenn Sie alle paar Schritte das Ausgangsbild erneut angeben, setzen Sie die Referenz zurück und stoppen das langsame Abgleiten.
Bekomme ich zweimal exakt dasselbe Ergebnis?
Nicht zuverlässig. Dialogische Bearbeitung stellt keinen seed bereit wie eine offene Pipeline. Das ist der generelle Tausch für die einfache Oberfläche.
Ist es besser als inpainting?
Es ist einfacher. Inpainting mit einer expliziten Maske gibt Ihnen exakte Kontrolle darüber, welche Pixel sich ändern dürfen; ein Satz überlässt dieses Urteil dem Modell. Für Präzisionsarbeit bleibt die Maske im Vorteil.
Kann es mit mehr als einem Referenzbild arbeiten?
Referenzen zu kombinieren wird oft verlangt; die Unterstützung variiert je nach Oberfläche und Version. Testen Sie es mit Ihrem eigenen Material statt sich auf Drittbeschreibungen zu verlassen.
Worin ist es schlecht?
Beim Start aus dem Nichts. Ohne Quellbild gibt es für die Konsistenzmechanik nichts zu bewahren, und für Text-zu-Bild bieten darauf spezialisierte Modelle mehr Kontrolle über Bildaufbau und Optik.
Funktioniert es auch bei nicht-menschlichen Motiven?
Ja, oft sogar zuverlässiger — bei einem Produkt oder Gebäude gibt es weniger Merkmale, die Betrachter so genau prüfen wie bei einem Gesicht.

Dieselben Ideen, anders benannt
Das Vokabular hinter dialogischer Bearbeitung
Weiter erkunden
Anderswo auf LaFoto
Bearbeiten ist ein Job. Das hier sind die anderen.
- kostenloses Bildgrößen-Tool
- JPG, PNG und WebP
- Bildkompressor
- ein Bild zuschneiden
- Bild-Farbpalette
- einen Hintergrund entfernen
- EXIF-Daten prüfen
- einen Prompt strukturieren
- Anime-KI-Generator
- ein Bild in einen Cartoon verwandeln
- Pixelart-Generator
- beste KI-Bildgeneratoren
- LaFoto vs Midjourney
- Alternative zu Leonardo AI
- im Vergleich mit Ideogram
- LaFoto vs Canva
- ein Bild reproduzieren
- Was ist denoise strength
- inpainting erklärt
- Anleitungen und Erklärungen
Nano Banana — questions people ask
- Was ist Nano Banana?
- Der inzwischen offiziell verwendete Spitzname für Googles Gemini-Modell zur Bildgenerierung und -bearbeitung. Es ist für konversationelle Bearbeitung gebaut, die ein Motiv über aufeinanderfolgende Änderungen konsistent hält.
- Wer hat Nano Banana gemacht?
- Google. Es gehört zur Gemini-Familie.
- Warum heisst es Nano Banana?
- Es tauchte anonym in öffentlichen Modell-Vergleichen unter diesem Platzhalter auf, lieferte auffallend gute Ergebnisse, und der Name blieb hängen. Google übernahm ihn statt dagegen anzukämpfen.
- Ist Nano Banana Open Source?
- Nein. Die Gewichte sind geschlossen, der Zugriff erfolgt über Googles App und API.
- Worin ist Nano Banana am besten?
- Ein bestehendes Bild zu bearbeiten und dabei das Motiv erkennbar zu erhalten — dasselbe Gesicht über mehrere aufeinanderfolgende Änderungen, das die meisten Bildmodelle nach ein-zwei Schritten verlieren.
- Ist Nano Banana besser als Midjourney?
- Sie lösen unterschiedliche Aufgaben. Midjourney setzt eine starke Ästhetik durch und wird genutzt, um aus dem Nichts markante Bilder zu erzeugen; Nano Banana versucht, nur das Gewünschte zu ändern und den Rest einer echten Aufnahme unangetastet zu lassen.
- Kann Nano Banana Bilder nur aus Text erzeugen?
- Ja, aber darin liegt nicht sein Vorteil. Die besondere Stärke ist, ein Motiv über Bearbeitungen hinweg zu bewahren — dafür braucht es ein Ausgangsbild.
- Verwendet LaFoto Nano Banana?
- Nein, und wir haben keine Verbindung zu Google. Diese Seite ist Nachschlagewerk in unserem Modellverzeichnis.
Die anderen Modelle im Verzeichnis
Heute starten
Generieren Sie Ihr erstes Bild mit dem besten KI-Bildgenerator.
Machen Sie aus einem Satz in Sekunden ein fertiges, fotorealistisches Bild — und verfeinern Sie danach jedes Detail. Kein Setup, kein Discord, keine GPU.
Schließen Sie sich 4.200+ Kreativen an, die LaFoto nutzen