Word2Vec
Jan 2013
AlphaGo
Mär 2016
Transformer
Jun 2017
BERT
Okt 2018
T5
Okt 2019
AlphaFold 2
Jul 2021
Chinchilla
Mär 2022
PaLM
Apr 2022
MusicLM
Jan 2023
PaLM 2
Mai 2023
Gemini
Dez 2023
Gemma
Feb 2024
Gemini 1.5 Pro
Feb 2024
Gemini 2.0
Dez 2024
Veo 2
Dez 2024
Genie 2
Dez 2024
Gemini 2.5 Pro
Mär 2025
Veo 3
Mai 2025
Gemini 3
Nov 2025
Gemma 4
Apr 2026
Gemini 3.5 Flash
Mai 2026
2013
2015
2017
2019
2021
2023
2025
Für Präsentation und Weitergabe
Als Bild in die Folien legen oder als einzelne HTML-Datei herunterladen und einbauen.
Bild
Alle Releases
Kategorie
Zu dieser Auswahl gibt es keinen Eintrag.
-
Word2Vec Grundlagen
- Lernte Wortvektoren, die semantische Beziehungen geometrisch abbilden.
- Berühmt für Analogien wie König minus Mann plus Frau ergibt Königin.
- Begründete den Durchbruch von Wort-Embeddings im NLP.
-
Seq2Seq Grundlagen
- Encoder-Decoder mit LSTMs übersetzte ganze Sequenzen in Sequenzen.
- Wurde zur Basis der neuronalen maschinellen Übersetzung.
- Bereitete den Weg für Attention und später die Transformer.
-
AlphaGo Grundlagen
- Schlug den Go-Weltklassespieler Lee Sedol mit 4 zu 1.
- Kombinierte tiefe neuronale Netze mit Monte-Carlo-Baumsuche.
- Galt als Meilenstein, Jahre früher als von Experten erwartet.
-
WaveNet Grundlagen
- Generierte rohe Audio-Wellenformen Sample für Sample.
- Hob die Qualität künstlicher Sprachsynthese deutlich an.
- Floss später in die Stimme des Google Assistant ein.
-
Transformer Grundlagen
- Führte mit Attention Is All You Need die Self-Attention ein und ersetzte rekurrente Netze.
- Ermöglichte massiv parallelisierbares Training auf langen Texten.
- Wurde zur Grundarchitektur fast aller heutigen großen Sprachmodelle.
-
BERT Grundlagen
- Bidirektionaler Transformer, der Kontext von links und rechts liest.
- Vortrainiert per Masked Language Modeling auf riesigen Textmengen.
- Setzte neue Bestmarken in vielen Aufgaben des Sprachverständnisses.
-
T5 Grundlagen
- Fasste alle NLP-Aufgaben als einheitliches Text-zu-Text-Problem auf.
- Trainiert auf dem großen C4-Korpus aus dem Web.
- Vereinheitlichte Übersetzung, Zusammenfassung und Klassifikation.
-
AlphaFold 2 Grundlagen
- Sagte 3D-Proteinstrukturen mit nahezu experimenteller Genauigkeit voraus.
- Löste ein 50 Jahre altes Grand-Challenge-Problem der Biologie.
- Die offene Datenbank deckte bald fast alle bekannten Proteine ab.
-
Chinchilla Grundlagen
- Zeigte, dass viele Modelle bis dahin deutlich zu wenig Daten sahen.
- Formulierte Skalierungsgesetze für rechenoptimales Training.
- Schlug mit 70 Milliarden Parametern viel größere Modelle.
-
PaLM Grundlagen
- Sprachmodell mit 540 Milliarden Parametern, trainiert via Pathways.
- Zeigte starke Fortschritte bei Reasoning und Chain-of-Thought.
- Demonstrierte emergente Fähigkeiten bei wachsender Modellgröße.
-
AudioLM Audio
- Modellierte Audio wie Sprache und setzte Klang kohärent fort.
- Erzeugte Sprache und Klavier ohne Text, nur aus Audio-Tokens.
- Legte die Grundlage für spätere Modelle wie MusicLM.
-
MusicLM Audio
- Erzeugte mehrminütige Musik aus Textbeschreibungen in hoher Treue.
- Steuerte Stimmung, Instrumente und Genre per Prompt.
- Zuerst als Forschung gezeigt, später via AI Test Kitchen geöffnet.
-
PaLM 2 Sprache
- Googles Nachfolger von PaLM, vorgestellt auf der I/O 2023.
- Trieb damals Bard und viele Google-Workspace-Funktionen an.
- Kam in mehreren Größen von Gecko bis Unicorn.
-
Lyria Audio
- Fortschrittliches Musikmodell, vorgestellt zusammen mit YouTube.
- Trieb die Experimente Dream Track und Music AI Tools an.
- Setzte auf SynthID-Wasserzeichen für KI-Musik.
-
Gemini Multimodal
- Von Grund auf multimodal gedacht
- Text, Bild, Audio & Code zusammen
- Googles direkte Antwort auf GPT-4
-
Imagen 2 Bild
- Googles fotorealistische Bild-KI mit deutlich höherer Bildqualität.
- Konnte erstmals Text und Logos zuverlässiger rendern.
- Über Vertex AI und Bard für Entwickler und Cloud-Kunden verfügbar.
-
Gemma Sprache
- Googles erste offene Modellfamilie (2B und 7B), abgeleitet von Gemini.
- Starke Qualität für die Größe, frei für Forschung und Kommerz.
- Lief gut auf Laptops, Workstations und in Google Cloud.
-
Gemini 1.5 Pro Multimodal
- Multimodales Modell mit damals riesigem 1-Million-Token-Kontext.
- Nutzte eine Mixture-of-Experts-Architektur.
- Konnte ganze Filme, Codebasen oder Bücher auf einmal erfassen.
-
Gemini 1.5 Flash Multimodal
- Schnelle, kostengünstige Variante von Gemini 1.5.
- Per Distillation aus dem größeren Pro-Modell gewonnen.
- Behielt den langen Kontext bei deutlich niedrigeren Kosten.
-
Gemma 2 Sprache
- Zweite Generation (2B, 9B, 27B) mit deutlich besserer Effizienz.
- 27B schlug Modelle der doppelten Größe in vielen Benchmarks.
- Knowledge Distillation und neue Architektur für mehr Leistung.
-
Imagen 3 Bild
- Googles bis dahin beste Bild-KI mit feineren Details und Texturen.
- Sehr gute Prompt-Treue und natürlichere Lichtführung.
- Basis für ImageFX und spätere Gemini-Bildfunktionen.
-
Gemini 2.0 Multimodal
- Auf agentische Aufgaben ausgelegt
- Schnelle, multimodale Ausgaben
- Tiefe Tool-Integration
-
Veo 2 Video
- Googles Video-KI mit bis zu 4K und besserem Physikverständnis.
- Beherrschte die Sprache der Kinematografie und Kameraführung.
- Galt als ernster Sora-Konkurrent von Google DeepMind.
-
Genie 2 Video
- DeepMinds Weltmodell, erzeugte spielbare 3D-Welten aus einem Bild.
- Per Tastatur und Maus in Echtzeit navigierbar, bis zu einer Minute.
- Emergente Physik, Objektinteraktion und Charakteranimation.
-
Gemini 2.5 Pro Multimodal
- Erstes Gemini mit eingebautem Thinking, das vor der Antwort reasoniert und so bei Mathe und Code führte.
- Verarbeitet bis zu eine Million Tokens Kontext über Text, Bild, Audio und Video hinweg.
- Brachte Google zurück an die Spitze vieler Benchmarks und wurde zum Arbeitstier für komplexe Aufgaben.
-
Gemma 3 Multimodal
- Multimodale offene Familie (1B bis 27B) mit Bildverständnis.
- Bis zu 128k-Kontext und Unterstützung für über 140 Sprachen.
- Lief stark auf einer einzelnen GPU, top unter offenen Modellen.
-
Lyria 2 Audio
- Professionelles Text-zu-Musik-Modell für hochauflösendes Audio.
- Über Vertex AI für Unternehmen verfügbar gemacht.
- Begleitet von Lyria RealTime für interaktives Streaming.
-
Veo 3 Video
- Erstes breit verfügbares Videomodell mit synchron erzeugtem Ton: Dialog, Geräusche und Musik.
- Löste das schwierigste Problem der KI-Videogenerierung, die lippensynchrone Kopplung von Bild und Audio.
- Auf der Google I/O vorgestellt, erzeugt Clips bis 1080p und befeuerte eine Welle viraler KI-Videos.
-
Imagen 4 Bild
- Auf der Google I/O 2025 vorgestellt, feinere Details und Stile.
- Deutlich bessere Textwiedergabe als Imagen 3.
- Familie aus Fast, Standard und Ultra für Tempo bis Maximalqualität.
-
Gemma 3n Multimodal
- Mobile-first Multimodal-Modell für Handys und Edge-Geräte.
- Versteht Text, Bild, Audio und Video bei minimalem Speicherbedarf.
- E2B und E4B laufen mit nur 2 bis 3 GB Arbeitsspeicher.
-
Nano Banana (Gemini 2.5 Flash Image) Bild
- Konversationelles Bildmodell: Bearbeitung per natürlicher Sprache mit konsistenten Charakteren.
- Mischt mehrere Bilder, macht punktgenaue lokale Edits und nutzt Geminis Weltwissen.
- Viraler Hit mit über 500 Millionen erzeugten Bildern und 23 Millionen neuen Nutzern in zwei Wochen.
-
Genie 3 Video
- DeepMinds Weltmodell, navigierbare Welten in Echtzeit mit 24 fps.
- Hielt Szenen über mehrere Minuten konsistent bei 720p.
- Galt als Schritt Richtung allgemeiner KI (AGI).
-
Gemini 3 Multimodal
- Googles neue Generation mit Rekordwerten auf Reasoning-Benchmarks und einem neuen Deep-Think-Modus.
- Vom ersten Tag an in Google-Suche, Gemini-App und Cloud für Milliarden Menschen ausgerollt.
- Begleitet von der agentischen Entwicklungsplattform Google Antigravity.
-
Gemini 3 Flash Multimodal
- Schnelles und günstiges Frontier-Modell für Bild, Video und Audio; seit dem 17. Dezember 2025 Standardmodell in der Gemini-App.
- Rund dreimal schneller als der Vorgänger bei etwa 30 Prozent weniger Reasoning-Tokens.
-
Project Genie Grundlagen
- Öffentliche Fassung des Weltmodells Genie 3: erzeugt aus Text- und Bildvorgaben in Echtzeit begehbare 3D-Welten.
- Die Umgebungen bleiben über Minuten kohärent und reagieren auf Bewegung und Aktionen; seit 29. Januar 2026 für Google-AI-Ultra-Abonnenten.
-
Nano Banana 2 (Gemini 3.1 Flash Image) Bild
- Nachfolger des populären Bildmodells Nano Banana, aus der Gemini-3.1-Reihe.
- Erzeugt und bearbeitet Bilder; seit Ende Februar 2026 als Vorschau in der Gemini-API.
-
Gemini 3.1 Pro Multimodal
- Aktualisiertes Pro-Flaggschiff der Gemini-3-Reihe mit stärkerem Reasoning.
- Seit dem 19. Februar 2026 als Vorschau über die Gemini-API verfügbar.
-
Lyria 3 Audio
- Musikgenerierungsmodell in einer Clip- und einer Pro-Variante.
- Seit dem 25. März 2026 über die Gemini-API verfügbar.
-
Gemma 4 Multimodal
- Offene Modellfamilie unter Apache 2.0 in vier Größen, die Text und Bild verarbeitet, teils auch Audio.
- 256K-Kontext und über 140 Sprachen; die 12B-Variante nutzt eine encoderfreie, vereinheitlichte multimodale Architektur.
-
Gemini 3.5 Flash Multimodal
- Nächste Flash-Generation von Google, seit Mai 2026 allgemein über die Gemini-API verfügbar.
- Schnelles und günstiges Arbeitspferd für Text, Bild, Audio und Video.
-
Gemini Omni Flash Video
- Auf der Google I/O vorgestelltes Any-to-any-Modell: nimmt Text, Bild, Audio und Video entgegen und erzeugt 720p-Video mit synchronem Ton.
- Videos werden im Gespräch über mehrere Runden bearbeitet, statt bei jedem Versuch neu erzeugt zu werden.
-
NanoBanana 2 Lite Bild
- Abgespeckte Variante des Nano-Banana-Bildmodells, die ein Bild in unter vier Sekunden erzeugt.
- Zielt auf Massenanwendungen: rund drei Cent pro Bild, dafür weniger Detailtreue als die große Fassung.
-
Gemini 3.6 Flash Multimodal
- Googles neues Arbeitspferd der Flash-Klasse: eine Million Token Eingabe, Text, Bild, Video, Audio und PDF als Eingabe.
- Braucht rund 17 Prozent weniger Ausgabe-Token als Gemini 3.5 Flash und legt zugleich bei Programmier- und Computer-Use-Aufgaben zu, etwa 58,7 statt 55,1 Prozent auf SWE-Bench Pro.
- Kostet 1,50 Dollar je Million Eingabe-Token und 7,50 Dollar je Million Ausgabe-Token.
-
Gemini 3.5 Flash-Lite Multimodal
- Günstigste Stufe der Gemini-3.5-Reihe für einfache Aufgaben in großer Menge.
- Kam gemeinsam mit Gemini 3.6 Flash, wobei Google zugleich Gemini 4 andeutete.
-
Gemini 3.5 Flash Cyber Code
- Erstes Google-Modell, das eigens darauf trainiert ist, Sicherheitslücken in Software zu finden, zu bestätigen und zu schließen.
- Löst 72 Prozent der Fälle in der Big-Sleep-Auswertung auf komplexen Codebasen, gegenüber 36 Prozent beim normalen Gemini 3.5 Flash.
- Wegen des Missbrauchsrisikos zunächst nur für Regierungen und ausgewählte Partner über CodeMender freigegeben.
-
Lyria 3.5 Audio
- Musikmodell in Google Flow Music, das Gesangsspuren von bis zu drei Minuten Länge erzeugt.
- Deutlich ausdrucksstärkere Stimmen, sauberere Aussprache und bessere Songtexte dank genauerer Prompt-Auswertung.
- Neu ist das Komponieren aus hochgeladenen Bildern sowie feinere Kontrolle über Tempo und Dauer.
-
Gemini Robotics 2 Grundlagen
- Erste Ganzkörper-Steuerung für humanoide Roboter: Gehen, Balancieren und präzises Greifen laufen in einem Modell zusammen, erprobt auf dem Apptronik Apollo 2.
- Fünffingrige Hände mit 22 Freiheitsgraden lösen Feinarbeit wie einen Knoten binden oder einen Zip-Beutel verschließen.
- Verschiedene Robotertypen stimmen sich ab und erledigen gemeinsam Abläufe, die einer allein nicht schafft. Zeitgleich erschienen Gemini Robotics ER 2 auf Basis von Gemini 3.5 Flash und das lokal laufende Gemini Robotics On-Device 2.
Gefüllter Punkt: Hauptversion. Offener Punkt: Zwischenstand oder Punkt-Release. Stand der Daten: Jul 2026.