Anbieter

Google

47 Releases · Jan 2013 bis Jul 2026 · im Schnitt alle 3,5 Monate · 7 Kategorien

Zurück zur Übersicht

Word2Vec Jan 2013 AlphaGo Mär 2016 Transformer Jun 2017 BERT Okt 2018 T5 Okt 2019 AlphaFold 2 Jul 2021 Chinchilla Mär 2022 PaLM Apr 2022 MusicLM Jan 2023 PaLM 2 Mai 2023 Gemini Dez 2023 Gemma Feb 2024 Gemini 1.5 Pro Feb 2024 Gemini 2.0 Dez 2024 Veo 2 Dez 2024 Genie 2 Dez 2024 Gemini 2.5 Pro Mär 2025 Veo 3 Mai 2025 Gemini 3 Nov 2025 Gemma 4 Apr 2026 Gemini 3.5 Flash Mai 2026 2013 2015 2017 2019 2021 2023 2025

Für Präsentation und Weitergabe

Als Bild in die Folien legen oder als einzelne HTML-Datei herunterladen und einbauen.

Bild
HTML herunterladen

Alle Releases

Kategorie
  1. Word2Vec Grundlagen

    • Lernte Wortvektoren, die semantische Beziehungen geometrisch abbilden.
    • Berühmt für Analogien wie König minus Mann plus Frau ergibt Königin.
    • Begründete den Durchbruch von Wort-Embeddings im NLP.

  2. Seq2Seq Grundlagen

    • Encoder-Decoder mit LSTMs übersetzte ganze Sequenzen in Sequenzen.
    • Wurde zur Basis der neuronalen maschinellen Übersetzung.
    • Bereitete den Weg für Attention und später die Transformer.

  3. AlphaGo Grundlagen

    • Schlug den Go-Weltklassespieler Lee Sedol mit 4 zu 1.
    • Kombinierte tiefe neuronale Netze mit Monte-Carlo-Baumsuche.
    • Galt als Meilenstein, Jahre früher als von Experten erwartet.

  4. WaveNet Grundlagen

    • Generierte rohe Audio-Wellenformen Sample für Sample.
    • Hob die Qualität künstlicher Sprachsynthese deutlich an.
    • Floss später in die Stimme des Google Assistant ein.

  5. Transformer Grundlagen

    • Führte mit Attention Is All You Need die Self-Attention ein und ersetzte rekurrente Netze.
    • Ermöglichte massiv parallelisierbares Training auf langen Texten.
    • Wurde zur Grundarchitektur fast aller heutigen großen Sprachmodelle.

  6. BERT Grundlagen

    • Bidirektionaler Transformer, der Kontext von links und rechts liest.
    • Vortrainiert per Masked Language Modeling auf riesigen Textmengen.
    • Setzte neue Bestmarken in vielen Aufgaben des Sprachverständnisses.

  7. T5 Grundlagen

    • Fasste alle NLP-Aufgaben als einheitliches Text-zu-Text-Problem auf.
    • Trainiert auf dem großen C4-Korpus aus dem Web.
    • Vereinheitlichte Übersetzung, Zusammenfassung und Klassifikation.

  8. AlphaFold 2 Grundlagen

    • Sagte 3D-Proteinstrukturen mit nahezu experimenteller Genauigkeit voraus.
    • Löste ein 50 Jahre altes Grand-Challenge-Problem der Biologie.
    • Die offene Datenbank deckte bald fast alle bekannten Proteine ab.

  9. Chinchilla Grundlagen

    • Zeigte, dass viele Modelle bis dahin deutlich zu wenig Daten sahen.
    • Formulierte Skalierungsgesetze für rechenoptimales Training.
    • Schlug mit 70 Milliarden Parametern viel größere Modelle.

  10. PaLM Grundlagen

    • Sprachmodell mit 540 Milliarden Parametern, trainiert via Pathways.
    • Zeigte starke Fortschritte bei Reasoning und Chain-of-Thought.
    • Demonstrierte emergente Fähigkeiten bei wachsender Modellgröße.

    Reihe PaLM

  11. AudioLM Audio

    • Modellierte Audio wie Sprache und setzte Klang kohärent fort.
    • Erzeugte Sprache und Klavier ohne Text, nur aus Audio-Tokens.
    • Legte die Grundlage für spätere Modelle wie MusicLM.

  12. MusicLM Audio

    • Erzeugte mehrminütige Musik aus Textbeschreibungen in hoher Treue.
    • Steuerte Stimmung, Instrumente und Genre per Prompt.
    • Zuerst als Forschung gezeigt, später via AI Test Kitchen geöffnet.

  13. PaLM 2 Sprache

    • Googles Nachfolger von PaLM, vorgestellt auf der I/O 2023.
    • Trieb damals Bard und viele Google-Workspace-Funktionen an.
    • Kam in mehreren Größen von Gecko bis Unicorn.

    Reihe PaLM

  14. Lyria Audio

    • Fortschrittliches Musikmodell, vorgestellt zusammen mit YouTube.
    • Trieb die Experimente Dream Track und Music AI Tools an.
    • Setzte auf SynthID-Wasserzeichen für KI-Musik.

    Reihe Lyria

  15. Gemini Multimodal

    • Von Grund auf multimodal gedacht
    • Text, Bild, Audio & Code zusammen
    • Googles direkte Antwort auf GPT-4

    Reihe Gemini

  16. Imagen 2 Bild

    • Googles fotorealistische Bild-KI mit deutlich höherer Bildqualität.
    • Konnte erstmals Text und Logos zuverlässiger rendern.
    • Über Vertex AI und Bard für Entwickler und Cloud-Kunden verfügbar.

    Reihe Imagen

  17. Gemma Sprache

    • Googles erste offene Modellfamilie (2B und 7B), abgeleitet von Gemini.
    • Starke Qualität für die Größe, frei für Forschung und Kommerz.
    • Lief gut auf Laptops, Workstations und in Google Cloud.

    Reihe Gemma

  18. Gemini 1.5 Pro Multimodal

    • Multimodales Modell mit damals riesigem 1-Million-Token-Kontext.
    • Nutzte eine Mixture-of-Experts-Architektur.
    • Konnte ganze Filme, Codebasen oder Bücher auf einmal erfassen.

    Reihe Gemini

  19. Gemini 1.5 Flash Multimodal

    • Schnelle, kostengünstige Variante von Gemini 1.5.
    • Per Distillation aus dem größeren Pro-Modell gewonnen.
    • Behielt den langen Kontext bei deutlich niedrigeren Kosten.

    Reihe Gemini

  20. Gemma 2 Sprache

    • Zweite Generation (2B, 9B, 27B) mit deutlich besserer Effizienz.
    • 27B schlug Modelle der doppelten Größe in vielen Benchmarks.
    • Knowledge Distillation und neue Architektur für mehr Leistung.

    Reihe Gemma

  21. Imagen 3 Bild

    • Googles bis dahin beste Bild-KI mit feineren Details und Texturen.
    • Sehr gute Prompt-Treue und natürlichere Lichtführung.
    • Basis für ImageFX und spätere Gemini-Bildfunktionen.

    Reihe Imagen

  22. Gemini 2.0 Multimodal

    • Auf agentische Aufgaben ausgelegt
    • Schnelle, multimodale Ausgaben
    • Tiefe Tool-Integration

    Reihe Gemini

  23. Veo 2 Video

    • Googles Video-KI mit bis zu 4K und besserem Physikverständnis.
    • Beherrschte die Sprache der Kinematografie und Kameraführung.
    • Galt als ernster Sora-Konkurrent von Google DeepMind.

    Reihe Veo

  24. Genie 2 Video

    • DeepMinds Weltmodell, erzeugte spielbare 3D-Welten aus einem Bild.
    • Per Tastatur und Maus in Echtzeit navigierbar, bis zu einer Minute.
    • Emergente Physik, Objektinteraktion und Charakteranimation.

    Reihe Genie

  25. Gemini 2.5 Pro Multimodal

    • Erstes Gemini mit eingebautem Thinking, das vor der Antwort reasoniert und so bei Mathe und Code führte.
    • Verarbeitet bis zu eine Million Tokens Kontext über Text, Bild, Audio und Video hinweg.
    • Brachte Google zurück an die Spitze vieler Benchmarks und wurde zum Arbeitstier für komplexe Aufgaben.

    Reihe Gemini

  26. Gemma 3 Multimodal

    • Multimodale offene Familie (1B bis 27B) mit Bildverständnis.
    • Bis zu 128k-Kontext und Unterstützung für über 140 Sprachen.
    • Lief stark auf einer einzelnen GPU, top unter offenen Modellen.

    Reihe Gemma

  27. Lyria 2 Audio

    • Professionelles Text-zu-Musik-Modell für hochauflösendes Audio.
    • Über Vertex AI für Unternehmen verfügbar gemacht.
    • Begleitet von Lyria RealTime für interaktives Streaming.

    Reihe Lyria

  28. Veo 3 Video

    • Erstes breit verfügbares Videomodell mit synchron erzeugtem Ton: Dialog, Geräusche und Musik.
    • Löste das schwierigste Problem der KI-Videogenerierung, die lippensynchrone Kopplung von Bild und Audio.
    • Auf der Google I/O vorgestellt, erzeugt Clips bis 1080p und befeuerte eine Welle viraler KI-Videos.

    Reihe Veo

  29. Imagen 4 Bild

    • Auf der Google I/O 2025 vorgestellt, feinere Details und Stile.
    • Deutlich bessere Textwiedergabe als Imagen 3.
    • Familie aus Fast, Standard und Ultra für Tempo bis Maximalqualität.

    Reihe Imagen

  30. Gemma 3n Multimodal

    • Mobile-first Multimodal-Modell für Handys und Edge-Geräte.
    • Versteht Text, Bild, Audio und Video bei minimalem Speicherbedarf.
    • E2B und E4B laufen mit nur 2 bis 3 GB Arbeitsspeicher.

    Reihe Gemma

  31. Nano Banana (Gemini 2.5 Flash Image) Bild

    • Konversationelles Bildmodell: Bearbeitung per natürlicher Sprache mit konsistenten Charakteren.
    • Mischt mehrere Bilder, macht punktgenaue lokale Edits und nutzt Geminis Weltwissen.
    • Viraler Hit mit über 500 Millionen erzeugten Bildern und 23 Millionen neuen Nutzern in zwei Wochen.

    Reihe Gemini

  32. Genie 3 Video

    • DeepMinds Weltmodell, navigierbare Welten in Echtzeit mit 24 fps.
    • Hielt Szenen über mehrere Minuten konsistent bei 720p.
    • Galt als Schritt Richtung allgemeiner KI (AGI).

    Reihe Genie

  33. Gemini 3 Multimodal

    • Googles neue Generation mit Rekordwerten auf Reasoning-Benchmarks und einem neuen Deep-Think-Modus.
    • Vom ersten Tag an in Google-Suche, Gemini-App und Cloud für Milliarden Menschen ausgerollt.
    • Begleitet von der agentischen Entwicklungsplattform Google Antigravity.

    Reihe Gemini

  34. Gemini 3 Flash Multimodal

    • Schnelles und günstiges Frontier-Modell für Bild, Video und Audio; seit dem 17. Dezember 2025 Standardmodell in der Gemini-App.
    • Rund dreimal schneller als der Vorgänger bei etwa 30 Prozent weniger Reasoning-Tokens.

    Reihe Gemini

  35. Project Genie Grundlagen

    • Öffentliche Fassung des Weltmodells Genie 3: erzeugt aus Text- und Bildvorgaben in Echtzeit begehbare 3D-Welten.
    • Die Umgebungen bleiben über Minuten kohärent und reagieren auf Bewegung und Aktionen; seit 29. Januar 2026 für Google-AI-Ultra-Abonnenten.

    Reihe Genie

  36. Nano Banana 2 (Gemini 3.1 Flash Image) Bild

    • Nachfolger des populären Bildmodells Nano Banana, aus der Gemini-3.1-Reihe.
    • Erzeugt und bearbeitet Bilder; seit Ende Februar 2026 als Vorschau in der Gemini-API.

    Reihe Gemini

  37. Gemini 3.1 Pro Multimodal

    • Aktualisiertes Pro-Flaggschiff der Gemini-3-Reihe mit stärkerem Reasoning.
    • Seit dem 19. Februar 2026 als Vorschau über die Gemini-API verfügbar.

    Reihe Gemini

  38. Lyria 3 Audio

    • Musikgenerierungsmodell in einer Clip- und einer Pro-Variante.
    • Seit dem 25. März 2026 über die Gemini-API verfügbar.

    Reihe Lyria

  39. Gemma 4 Multimodal

    • Offene Modellfamilie unter Apache 2.0 in vier Größen, die Text und Bild verarbeitet, teils auch Audio.
    • 256K-Kontext und über 140 Sprachen; die 12B-Variante nutzt eine encoderfreie, vereinheitlichte multimodale Architektur.

    Reihe Gemma

  40. Gemini 3.5 Flash Multimodal

    • Nächste Flash-Generation von Google, seit Mai 2026 allgemein über die Gemini-API verfügbar.
    • Schnelles und günstiges Arbeitspferd für Text, Bild, Audio und Video.

    Reihe Gemini

  41. Gemini Omni Flash Video

    • Auf der Google I/O vorgestelltes Any-to-any-Modell: nimmt Text, Bild, Audio und Video entgegen und erzeugt 720p-Video mit synchronem Ton.
    • Videos werden im Gespräch über mehrere Runden bearbeitet, statt bei jedem Versuch neu erzeugt zu werden.

    Reihe Gemini

  42. NanoBanana 2 Lite Bild

    • Abgespeckte Variante des Nano-Banana-Bildmodells, die ein Bild in unter vier Sekunden erzeugt.
    • Zielt auf Massenanwendungen: rund drei Cent pro Bild, dafür weniger Detailtreue als die große Fassung.

    Reihe Gemini

  43. Gemini 3.6 Flash Multimodal

    • Googles neues Arbeitspferd der Flash-Klasse: eine Million Token Eingabe, Text, Bild, Video, Audio und PDF als Eingabe.
    • Braucht rund 17 Prozent weniger Ausgabe-Token als Gemini 3.5 Flash und legt zugleich bei Programmier- und Computer-Use-Aufgaben zu, etwa 58,7 statt 55,1 Prozent auf SWE-Bench Pro.
    • Kostet 1,50 Dollar je Million Eingabe-Token und 7,50 Dollar je Million Ausgabe-Token.

    Reihe Gemini

  44. Gemini 3.5 Flash-Lite Multimodal

    • Günstigste Stufe der Gemini-3.5-Reihe für einfache Aufgaben in großer Menge.
    • Kam gemeinsam mit Gemini 3.6 Flash, wobei Google zugleich Gemini 4 andeutete.

    Reihe Gemini

  45. Gemini 3.5 Flash Cyber Code

    • Erstes Google-Modell, das eigens darauf trainiert ist, Sicherheitslücken in Software zu finden, zu bestätigen und zu schließen.
    • Löst 72 Prozent der Fälle in der Big-Sleep-Auswertung auf komplexen Codebasen, gegenüber 36 Prozent beim normalen Gemini 3.5 Flash.
    • Wegen des Missbrauchsrisikos zunächst nur für Regierungen und ausgewählte Partner über CodeMender freigegeben.

    Reihe Gemini

  46. Lyria 3.5 Audio

    • Musikmodell in Google Flow Music, das Gesangsspuren von bis zu drei Minuten Länge erzeugt.
    • Deutlich ausdrucksstärkere Stimmen, sauberere Aussprache und bessere Songtexte dank genauerer Prompt-Auswertung.
    • Neu ist das Komponieren aus hochgeladenen Bildern sowie feinere Kontrolle über Tempo und Dauer.

    Reihe Lyria Quelle blog.google

  47. Gemini Robotics 2 Grundlagen

    • Erste Ganzkörper-Steuerung für humanoide Roboter: Gehen, Balancieren und präzises Greifen laufen in einem Modell zusammen, erprobt auf dem Apptronik Apollo 2.
    • Fünffingrige Hände mit 22 Freiheitsgraden lösen Feinarbeit wie einen Knoten binden oder einen Zip-Beutel verschließen.
    • Verschiedene Robotertypen stimmen sich ab und erledigen gemeinsam Abläufe, die einer allein nicht schafft. Zeitgleich erschienen Gemini Robotics ER 2 auf Basis von Gemini 3.5 Flash und das lokal laufende Gemini Robotics On-Device 2.

    Quelle deepmind.google

Gefüllter Punkt: Hauptversion. Offener Punkt: Zwischenstand oder Punkt-Release. Stand der Daten: Jul 2026.