Google hat am 6. Oktober Nano Banana 2.1 veröffentlicht — eine Aktualisierung seines Gemini-Bildmodells, die laut Unternehmen die visuelle Qualität, die Charakterkonsistenz über mehrere Runden, die Textwiedergabe und die sucherdgestützte Generierung verbessert und zugleich die Preise für die erzeugten Bilder etwa halbiert.

Das Modell basiert auf Gemini 3.6 Flash und wird als Mitglied der Gemini-3-Reihe nativ multimodaler Reasoning-Modelle dokumentiert. In der Gemini API kostet die Bildausgabe im kostenpflichtigen Tarif 30 Dollar pro Million Token; Google setzt das mit 0,0336 Dollar pro 1K-Bild, 0,0504 Dollar pro 2K- und 0,0756 Dollar pro 4K-Bild gleich. Das abgelöste Gemini 3.1 Flash Image — bekannt als Nano Banana 2 — kostete 60 Dollar pro Million Bild-Token, also 0,067, 0,101 und 0,151 Dollar pro Bild in denselben Auflösungen. Text- und Thinking-Ausgabe kosten 7,50 Dollar pro Million Token, Text-, Bild- und Videoeingabe 1,50 Dollar. Batch-Jobs werden zur Hälfte abgerechnet.

Google hat Nano Banana 2 am selben Tag als veraltet eingestuft und nennt den 29. Oktober 2026 als Abschaltdatum. Entwickler haben damit gut drei Wochen, um auf die neue Modellkennung gemini-nano-banana-2.1 zu wechseln.

Die dokumentierten Grenzen sind großzügig: Text und Bilder als Eingabe, Bild und Text als Ausgabe, Video nur als Eingabe, Audio gar nicht. Die Enterprise-Dokumentation nennt ein Kontextfenster von 131.072 Token mit bis zu 32.768 Ausgabe-Token, bis zu 14 Bilder pro Prompt in Seitenverhältnissen von 1:1 bis 21:9 sowie Ausgaben in 1K, 2K und 4K. Jedes Eingabebild verbraucht 1.120 Token, ein 1K-Ausgabebild ebenso, ein 2K-Bild 1.680. Das Modell verarbeitet bis zu 14 Referenzbilder gleichzeitig, hält bis zu vier Charaktere und zehn Objekte konsistent und bietet minimale, mittlere und hohe Thinking-Stufen, die Latenz gegen Bildqualität tauschen. Mehrstufige Bearbeitung, verschachtelte Bild-Text-Ausgabe, C2PA Content Credentials und virtuelles Anprobieren werden unterstützt; das Erzeugen von Personen nicht.

Die veröffentlichten Zahlen sollte man mit Vorsicht lesen. Googles Modellkarte meldet bei Text-zu-Bild und Bearbeitungsaufgaben Elo-Werte aus menschlicher Bewertung oberhalb von Nano Banana 2 und Nano Banana Pro — eine Overall-Preference-Elo von 1050 ±14 in der Thinking-Konfiguration für Text-zu-Bild und 1106 für Multi-Character-Konsistenz beim Editieren — und erklärt, das Modell erfülle die geforderten Kinderschutz-Schwellen. Doch in derselben Tabelle liegt das abgeschaltete Nano Banana 2 ebenfalls überall über Gemini 3 Pro Image, und in direkten Vergleichstests lieferte Nano Banana Pro in der Praxis weiterhin die realistischeren Bilder, während 2.1 mit Maßstäben kämpft. Google beschreibt 2.1 als den „effizienteren Gegenpart“ zu Pro. Die Karte listet zudem die üblichen Einschränkungen: Halluzinationen, gelegentliche Langsamkeit oder Timeouts, schwache Darstellung kleiner Schrift und langer Absätze, unvollkommene Charakterkonsistenz zwischen Eingabe und erzeugtem Bild sowie begrenztes Weltwissen, 3D-Reasoning und Faktenzuverlässigkeit.

Verfügbar ist das Modell in der Gemini-App, in Google AI Studio, über die Gemini API, im AI-Modus der Google-Suche, in Google Ads, Google Flow und Google Stitch. Einen kostenlosen Tarif nennt Google für das neue Modell nicht.