GPT-1
Jun 2018
GPT-2
Feb 2019
Jukebox
Apr 2020
GPT-3
Jun 2020
DALL·E
Jan 2021
CLIP
Jan 2021
GitHub Copilot
Jun 2021
DALL·E 2
Apr 2022
Whisper
Sep 2022
ChatGPT
Nov 2022
GPT-4
Mär 2023
DALL·E 3
Sep 2023
GPT-4 Turbo
Nov 2023
Sora
Feb 2024
GPT-4o
Mai 2024
o1
Sep 2024
GPT-4o Advanced Voice
Sep 2024
GPT-4.5
Feb 2025
GPT Image 1
Mär 2025
o3
Apr 2025
GPT-5
Aug 2025
gpt-oss
Aug 2025
Sora 2
Sep 2025
GPT-5.2
Dez 2025
GPT-5.3-Codex
Feb 2026
GPT-5.4
Mär 2026
GPT-5.5
Apr 2026
GPT Image 2
Apr 2026
GPT-Live-1
Jul 2026
2020
2022
2024
2026
Für Präsentation und Weitergabe
Als Bild in die Folien legen oder als einzelne HTML-Datei herunterladen und einbauen.
Bild
Alle Releases
Kategorie
Zu dieser Auswahl gibt es keinen Eintrag.
-
GPT-1 Grundlagen
- Erstes generatives, auf dem Transformer basierendes Sprachmodell von OpenAI.
- Zeigte, dass Vortraining plus Feintuning aufgabenspezifische Netze schlägt.
- Legte den Grundstein für die gesamte GPT-Reihe.
-
GPT-2 Grundlagen
- Großes Sprachmodell mit bis zu 1,5 Milliarden Parametern.
- Erzeugte erstmals erstaunlich flüssige, lange Texte.
- Wurde wegen Missbrauchssorgen zunächst nur stufenweise veröffentlicht.
-
Jukebox Audio
- Erzeugte komplette Songs inklusive rohem Gesang direkt als Audiowellenform.
- Nutzte Genre, Künstlerstil und Songtext als Eingabe.
- Galt als früher Meilenstein neuronaler Musikgenerierung.
-
GPT-3 Sprache
- Texte fortsetzen & generieren aus kurzen Anweisungen
- Erste breit nutzbare Few-Shot-Sprachfähigkeit
- Startschuss der heutigen LLM-Welle
-
DALL·E Bild
- Bilder aus Textbeschreibungen erzeugen
- Kombiniert Konzepte zu neuen Motiven
- Zeigt Text-zu-Bild als ernsthafte Richtung
-
CLIP Grundlagen
- Verknüpfte Bilder und Texte in einem gemeinsamen Vektorraum.
- Ermöglichte Zero-Shot-Bildklassifikation per Textbeschreibung.
- Wurde zum Baustein vieler Text-zu-Bild-Generatoren.
-
GitHub Copilot Code
- Code-Vorschläge direkt im Editor
- Vervollständigt ganze Funktionen aus Kommentaren
- Macht KI-Coding alltagstauglich
-
DALL·E 2 Bild
- Deutlich höhere Bildqualität & Auflösung
- Bildbereiche gezielt ersetzen (Inpainting)
- Variationen eines Motivs erstellen
-
Whisper Audio
- Robuste Spracherkennung (ASR), trainiert auf 680.000 Stunden Audio.
- Transkribierte rund 100 Sprachen und übersetzte ins Englische.
- Als Open Source zum De-facto-Standard für Transkription geworden.
-
ChatGPT Sprache
- Dialog statt nur Textvervollständigung
- Erklärt, entwirft, fasst zusammen
- Der Moment, ab dem KI jeden erreicht
-
GPT-4 Multimodal
- Versteht Text und Bilder
- Spürbar besseres Schlussfolgern
- Zuverlässiger bei komplexen Aufgaben
-
DALL·E 3 Bild
- Deutlich bessere Prompt-Treue, setzte auch lange Beschreibungen genau um.
- Erste tief in ChatGPT integrierte Bild-KI, Prompts per Dialog verfeinerbar.
- Konnte erstmals brauchbar Text und Schrift im Bild darstellen.
-
GPT-4 Turbo Multimodal
- Größeres Kontextfenster
- Günstiger & schneller
- Frischeres Wissen
-
Sora Video
- Video aus Textbeschreibung
- Erstaunlich kohärente Bewegung & Szenen
- Macht Text-zu-Video greifbar
-
Voice Engine Audio
- Klonte eine Stimme aus nur 15 Sekunden Referenzaudio.
- Erzeugte natürlich klingende Sprache in mehreren Sprachen.
- Aus Missbrauchssorge nur an wenige Partner ausgegeben.
-
GPT-4o Multimodal
- Echtzeit-Sprache, Bild & Text in einem
- Schnell und natürlich im Dialog
- Multimodal als Standard
-
GPT-4o mini Multimodal
- Kleines, sehr günstiges Modell als Ersatz für GPT-3.5 Turbo.
- Multimodal mit Text- und Bildverständnis.
- Brachte starke Leistung zu sehr niedrigem Preis in die API.
-
o1 Sprache
- Denkt vor der Antwort nach
- Stark bei Mathe & komplexer Logik
- Neue Reasoning-Modellklasse
-
GPT-4o Advanced Voice Audio
- Brachte ChatGPT natürliche, emotionale Echtzeit-Sprachdialoge.
- Verstand Tonfall und antwortete mit ausdrucksstarker Stimme.
- Lief auf dem multimodalen, audionativen GPT-4o.
-
Realtime API Audio
- Gab Entwicklern Echtzeit-Sprach-zu-Sprach mit geringer Latenz.
- Ermöglichte multimodale Sprachagenten direkt per API.
- Basierte auf den Audiofähigkeiten von GPT-4o.
-
o3-mini Sprache
- Kompaktes Reasoning-Modell der o-Reihe mit sichtbaren Denkschritten.
- Stark in Mathematik, Coding und Wissenschaft bei niedrigen Kosten.
- Bot wählbare Denk-Aufwandsstufen (niedrig, mittel, hoch).
-
GPT-4.5 Sprache
- OpenAIs größtes klassisch vortrainiertes Modell, mit breiterem Weltwissen und weniger Halluzinationen.
- Galt als letzter großer Schritt der reinen Pretraining-Skalierung und zeigte deren abnehmenden Ertrag.
- Blieb trotz angenehmerem Ton bei Mathe und Code hinter den Reasoning-Modellen zurück und wurde bald abgelöst.
-
GPT Image 1 Bild
- Native Bilderzeugung direkt im GPT-4o, löste den Ghibli-Hype aus.
- Sehr starke Prompt-Treue, Textwiedergabe und Bildbearbeitung im Chat.
- Machte präzises, mehrstufiges Bild-Editing per Dialog massentauglich.
-
o3 Sprache
- Reasoning-Modelle o3 und o4-mini, die erstmals während des Denkens selbstständig Werkzeuge nutzen.
- Sie denken mit Bildern, zoomen und analysieren also visuelle Inhalte als Teil der Schlussfolgerung.
- Web-Suche, Python und Bildverarbeitung im Reasoning-Loop machten echte agentische Aufgaben möglich.
-
GPT-4.1 Code
- API-Modellreihe mit starkem Fokus auf Programmierung.
- Bot bis zu 1 Million Token Kontext und bessere Instruktionstreue.
- Kam in den Größen Standard, mini und nano.
-
o4-mini Multimodal
- Kompaktes Reasoning-Modell, das auch mit Bildern denken kann.
- Konnte Werkzeuge wie Websuche und Python im Denkprozess nutzen.
- Bot starke Mathematik- und Coding-Leistung sehr effizient.
-
GPT-5 Multimodal
- Vereintes System, das selbst entscheidet, wann es schnell antwortet und wann es länger nachdenkt.
- Deutlich seltener Halluzinationen und Spitzenwerte bei Code, Mathe und multimodalem Verständnis.
- Löste GPT-4o als Standardmodell von ChatGPT ab und brachte 400.000 Tokens Kontext.
-
gpt-oss Sprache
- OpenAIs erste offene Gewichte seit GPT-2 (gpt-oss-120b und 20b).
- Reasoning-Modelle mit einstellbarem Denkaufwand, Apache 2.0.
- 120b lief auf einer 80-GB-GPU, 20b auf Consumer-Hardware.
-
Sora 2 Video
- Nachfolger von Sora mit physikalisch realistischeren Clips und synchronem Dialog und Soundeffekten.
- Erschien zusammen mit einer eigenen Social-App, die KI-Videos zum Massenphänomen machte.
- Erlaubt Cameos, also das kontrollierte Einsetzen echter Personen in generierte Szenen.
-
GPT-5.1 Sprache
- Aktualisierung von GPT-5 mit wärmerem, gesprächigerem Ton.
- Erschien in den Varianten Instant und Thinking.
- Passte die Denkzeit adaptiv an die Schwierigkeit der Aufgabe an.
-
GPT-5.2 Sprache
- Frontier-Modell für berufliche Arbeit und langlaufende Agenten, stark bei Tabellen, Präsentationen, Code und langen Kontexten.
- Übertrifft im GDPval-Benchmark Fachleute bei gut definierten Wissensaufgaben aus 44 Berufen.
- Erschien am 11. Dezember 2025 in drei Modi: Instant, Thinking und Pro.
-
GPT-5.2-Codex Code
- Agentisches Coding-Modell für den Codex-Agenten, zeitgleich mit GPT-5.2 veröffentlicht.
- Optimiert für Codegenerierung, Fehlersuche und lange Entwickler-Workflows.
-
GPT-5.3-Codex Code
- Bis dahin fähigstes agentisches Coding-Modell: vereint den Codex- und den GPT-5-Trainingsstack und arbeitet rund 25 Prozent schneller.
- Spitzenwerte auf SWE-Bench Pro und Terminal-Bench 2.0.
-
GPT-5.3-Codex-Spark Code
- Kleinere Echtzeit-Variante von GPT-5.3-Codex mit über 1000 Tokens pro Sekunde auf Cerebras-Hardware.
- Erster Meilenstein der Partnerschaft von OpenAI und Cerebras.
-
GPT-5.4 Sprache
- Frontier-Modell mit integrierter Computernutzung und 75 Prozent auf OSWorld-Verified, dazu eine verbesserte Deep-Research-Funktion.
- Rund 33 Prozent weniger Faktenfehler als GPT-5.2; erschien am 5. März 2026, mini und nano folgten am 17. März.
-
GPT-5.5 Multimodal
- OpenAIs agentisches Flagship, das mehrstufige Aufgaben selbstständig über viele Werkzeuge hinweg erledigt.
- Besonders stark bei agentischem Coding, Computer-Nutzung und früher wissenschaftlicher Recherche.
- Erholt sich besser von Fehlern mitten in der Aufgabe und hält Kohärenz über lange Kontexte.
-
GPT Image 2 Bild
- Bildmodell mit nahezu perfektem Textrendering, auch für Chinesisch, Japanisch, Koreanisch, Hindi und Bengali.
- Bis zu 4K-Auflösung und Reasoning-gestützte Erzeugung; löst DALL-E 3 ab und belegte binnen zwölf Stunden Platz 1 aller Kategorien der Image Arena.
-
GPT-Rosalind Grundlagen
- Erstes vertikales OpenAI-Modell für die Life-Sciences-Forschung, mit biologischem Reasoning, Medizinalchemie und Genomik-Analyse.
- Nur über ein Trusted-Access-Programm verfügbar.
-
GPT-Realtime-2 Audio
- API-Sprachmodell mit dem Reasoning der GPT-5-Reihe, erstmals mit per Anweisung steuerbarem Sprechstil.
- Zusammen mit GPT-Realtime-Translate (Live-Übersetzung aus über 70 Sprachen) und GPT-Realtime-Whisper (streamende Transkription) veröffentlicht.
-
GPT-5.6 (Sol, Terra, Luna) Multimodal
- Neue Frontier-Familie in drei Stufen: Sol als Flaggschiff, Terra als günstigere Mittelklasse, Luna als schnellstes und billigstes Modell.
- Terra erreicht das Niveau von GPT-5.5 zum halben Preis; Sol arbeitet beim agentischen Programmieren rund 54 Prozent token-effizienter.
- Nach eingeschränkter Vorschau ab dem 26. Juni am 9. Juli 2026 allgemein in ChatGPT, Codex und der API freigegeben.
-
GPT-Live-1 Audio
- Voll-duplexes Sprachmodell: hört und spricht gleichzeitig, erlaubt natürliches Unterbrechen und Live-Übersetzung.
- Löst den bisherigen Advanced Voice Mode in ChatGPT ab und reicht schwere Anfragen im Hintergrund an das Frontier-Modell weiter.
Gefüllter Punkt: Hauptversion. Offener Punkt: Zwischenstand oder Punkt-Release. Stand der Daten: Jul 2026.