Multimodales Modell mit damals riesigem 1-Million-Token-Kontext.
Nutzte eine Mixture-of-Experts-Architektur.
Konnte ganze Filme, Codebasen oder Bücher auf einmal erfassen.
Gemini 1.5 Flash Multimodal
Schnelle, kostengünstige Variante von Gemini 1.5.
Per Distillation aus dem größeren Pro-Modell gewonnen.
Behielt den langen Kontext bei deutlich niedrigeren Kosten.
Gemini 2.0 Multimodal
Auf agentische Aufgaben ausgelegt
Schnelle, multimodale Ausgaben
Tiefe Tool-Integration
Gemini 2.5 Pro Multimodal
Erstes Gemini mit eingebautem Thinking, das vor der Antwort reasoniert und so bei Mathe und Code führte.
Verarbeitet bis zu eine Million Tokens Kontext über Text, Bild, Audio und Video hinweg.
Brachte Google zurück an die Spitze vieler Benchmarks und wurde zum Arbeitstier für komplexe Aufgaben.
Nano Banana (Gemini 2.5 Flash Image) Bild
Konversationelles Bildmodell: Bearbeitung per natürlicher Sprache mit konsistenten Charakteren.
Mischt mehrere Bilder, macht punktgenaue lokale Edits und nutzt Geminis Weltwissen.
Viraler Hit mit über 500 Millionen erzeugten Bildern und 23 Millionen neuen Nutzern in zwei Wochen.
Gemini 3 Multimodal
Googles neue Generation mit Rekordwerten auf Reasoning-Benchmarks und einem neuen Deep-Think-Modus.
Vom ersten Tag an in Google-Suche, Gemini-App und Cloud für Milliarden Menschen ausgerollt.
Begleitet von der agentischen Entwicklungsplattform Google Antigravity.
Gemini 3 Flash Multimodal
Schnelles und günstiges Frontier-Modell für Bild, Video und Audio; seit dem 17. Dezember 2025 Standardmodell in der Gemini-App.
Rund dreimal schneller als der Vorgänger bei etwa 30 Prozent weniger Reasoning-Tokens.
Nano Banana 2 (Gemini 3.1 Flash Image) Bild
Nachfolger des populären Bildmodells Nano Banana, aus der Gemini-3.1-Reihe.
Erzeugt und bearbeitet Bilder; seit Ende Februar 2026 als Vorschau in der Gemini-API.
Gemini 3.1 Pro Multimodal
Aktualisiertes Pro-Flaggschiff der Gemini-3-Reihe mit stärkerem Reasoning.
Seit dem 19. Februar 2026 als Vorschau über die Gemini-API verfügbar.
Gemini 3.5 Flash Multimodal
Nächste Flash-Generation von Google, seit Mai 2026 allgemein über die Gemini-API verfügbar.
Schnelles und günstiges Arbeitspferd für Text, Bild, Audio und Video.
Gemini Omni Flash Video
Auf der Google I/O vorgestelltes Any-to-any-Modell: nimmt Text, Bild, Audio und Video entgegen und erzeugt 720p-Video mit synchronem Ton.
Videos werden im Gespräch über mehrere Runden bearbeitet, statt bei jedem Versuch neu erzeugt zu werden.
NanoBanana 2 Lite Bild
Abgespeckte Variante des Nano-Banana-Bildmodells, die ein Bild in unter vier Sekunden erzeugt.
Zielt auf Massenanwendungen: rund drei Cent pro Bild, dafür weniger Detailtreue als die große Fassung.
Gemini 3.6 Flash Multimodal
Googles neues Arbeitspferd der Flash-Klasse: eine Million Token Eingabe, Text, Bild, Video, Audio und PDF als Eingabe.
Braucht rund 17 Prozent weniger Ausgabe-Token als Gemini 3.5 Flash und legt zugleich bei Programmier- und Computer-Use-Aufgaben zu, etwa 58,7 statt 55,1 Prozent auf SWE-Bench Pro.
Kostet 1,50 Dollar je Million Eingabe-Token und 7,50 Dollar je Million Ausgabe-Token.
Gemini 3.5 Flash-Lite Multimodal
Günstigste Stufe der Gemini-3.5-Reihe für einfache Aufgaben in großer Menge.
Kam gemeinsam mit Gemini 3.6 Flash, wobei Google zugleich Gemini 4 andeutete.
Gemini 3.5 Flash Cyber Code
Erstes Google-Modell, das eigens darauf trainiert ist, Sicherheitslücken in Software zu finden, zu bestätigen und zu schließen.
Löst 72 Prozent der Fälle in der Big-Sleep-Auswertung auf komplexen Codebasen, gegenüber 36 Prozent beim normalen Gemini 3.5 Flash.
Wegen des Missbrauchsrisikos zunächst nur für Regierungen und ausgewählte Partner über CodeMender freigegeben.