Anbieter

OpenAI

41 Releases · Jun 2018 bis Jul 2026 · im Schnitt alle 2,4 Monate · 7 Kategorien

digitalpfade digitalpfa.de/zeitstrahl/firma/openai
GPT-1 Jun 2018 GPT-2 Feb 2019 Jukebox Apr 2020 GPT-3 Jun 2020 DALL·E Jan 2021 CLIP Jan 2021 GitHub Copilot Jun 2021 DALL·E 2 Apr 2022 Whisper Sep 2022 ChatGPT Nov 2022 GPT-4 Mär 2023 DALL·E 3 Sep 2023 GPT-4 Turbo Nov 2023 Sora Feb 2024 GPT-4o Mai 2024 o1 Sep 2024 GPT-4o Advanced Voice Sep 2024 GPT-4.5 Feb 2025 GPT Image 1 Mär 2025 o3 Apr 2025 GPT-5 Aug 2025 gpt-oss Aug 2025 Sora 2 Sep 2025 GPT-5.2 Dez 2025 GPT-5.3-Codex Feb 2026 GPT-5.4 Mär 2026 GPT-5.5 Apr 2026 GPT Image 2 Apr 2026 GPT-Live-1 Jul 2026 2020 2022 2024 2026

Alle Releases

  1. GPT-1 Grundlagen

    • Erstes generatives, auf dem Transformer basierendes Sprachmodell von OpenAI.
    • Zeigte, dass Vortraining plus Feintuning aufgabenspezifische Netze schlägt.
    • Legte den Grundstein für die gesamte GPT-Reihe.

    Reihe GPT

  2. GPT-2 Grundlagen

    • Großes Sprachmodell mit bis zu 1,5 Milliarden Parametern.
    • Erzeugte erstmals erstaunlich flüssige, lange Texte.
    • Wurde wegen Missbrauchssorgen zunächst nur stufenweise veröffentlicht.

    Reihe GPT

  3. Jukebox Audio

    • Erzeugte komplette Songs inklusive rohem Gesang direkt als Audiowellenform.
    • Nutzte Genre, Künstlerstil und Songtext als Eingabe.
    • Galt als früher Meilenstein neuronaler Musikgenerierung.

  4. GPT-3 Sprache

    • Texte fortsetzen & generieren aus kurzen Anweisungen
    • Erste breit nutzbare Few-Shot-Sprachfähigkeit
    • Startschuss der heutigen LLM-Welle

    Reihe GPT

  5. DALL·E Bild

    • Bilder aus Textbeschreibungen erzeugen
    • Kombiniert Konzepte zu neuen Motiven
    • Zeigt Text-zu-Bild als ernsthafte Richtung

    Reihe DALL-E

  6. CLIP Grundlagen

    • Verknüpfte Bilder und Texte in einem gemeinsamen Vektorraum.
    • Ermöglichte Zero-Shot-Bildklassifikation per Textbeschreibung.
    • Wurde zum Baustein vieler Text-zu-Bild-Generatoren.

  7. GitHub Copilot Code

    • Code-Vorschläge direkt im Editor
    • Vervollständigt ganze Funktionen aus Kommentaren
    • Macht KI-Coding alltagstauglich

  8. DALL·E 2 Bild

    • Deutlich höhere Bildqualität & Auflösung
    • Bildbereiche gezielt ersetzen (Inpainting)
    • Variationen eines Motivs erstellen

    Reihe DALL-E

  9. Whisper Audio

    • Robuste Spracherkennung (ASR), trainiert auf 680.000 Stunden Audio.
    • Transkribierte rund 100 Sprachen und übersetzte ins Englische.
    • Als Open Source zum De-facto-Standard für Transkription geworden.

  10. ChatGPT Sprache

    • Dialog statt nur Textvervollständigung
    • Erklärt, entwirft, fasst zusammen
    • Der Moment, ab dem KI jeden erreicht

    Reihe GPT

  11. GPT-4 Multimodal

    • Versteht Text und Bilder
    • Spürbar besseres Schlussfolgern
    • Zuverlässiger bei komplexen Aufgaben

    Reihe GPT

  12. DALL·E 3 Bild

    • Deutlich bessere Prompt-Treue, setzte auch lange Beschreibungen genau um.
    • Erste tief in ChatGPT integrierte Bild-KI, Prompts per Dialog verfeinerbar.
    • Konnte erstmals brauchbar Text und Schrift im Bild darstellen.

    Reihe DALL-E

  13. GPT-4 Turbo Multimodal

    • Größeres Kontextfenster
    • Günstiger & schneller
    • Frischeres Wissen

    Reihe GPT

  14. Sora Video

    • Video aus Textbeschreibung
    • Erstaunlich kohärente Bewegung & Szenen
    • Macht Text-zu-Video greifbar

    Reihe Sora

  15. Voice Engine Audio

    • Klonte eine Stimme aus nur 15 Sekunden Referenzaudio.
    • Erzeugte natürlich klingende Sprache in mehreren Sprachen.
    • Aus Missbrauchssorge nur an wenige Partner ausgegeben.

  16. GPT-4o Multimodal

    • Echtzeit-Sprache, Bild & Text in einem
    • Schnell und natürlich im Dialog
    • Multimodal als Standard

    Reihe GPT

  17. GPT-4o mini Multimodal

    • Kleines, sehr günstiges Modell als Ersatz für GPT-3.5 Turbo.
    • Multimodal mit Text- und Bildverständnis.
    • Brachte starke Leistung zu sehr niedrigem Preis in die API.

    Reihe GPT

  18. o1 Sprache

    • Denkt vor der Antwort nach
    • Stark bei Mathe & komplexer Logik
    • Neue Reasoning-Modellklasse

    Reihe o-Serie

  19. GPT-4o Advanced Voice Audio

    • Brachte ChatGPT natürliche, emotionale Echtzeit-Sprachdialoge.
    • Verstand Tonfall und antwortete mit ausdrucksstarker Stimme.
    • Lief auf dem multimodalen, audionativen GPT-4o.

    Reihe GPT

  20. Realtime API Audio

    • Gab Entwicklern Echtzeit-Sprach-zu-Sprach mit geringer Latenz.
    • Ermöglichte multimodale Sprachagenten direkt per API.
    • Basierte auf den Audiofähigkeiten von GPT-4o.

  21. o3-mini Sprache

    • Kompaktes Reasoning-Modell der o-Reihe mit sichtbaren Denkschritten.
    • Stark in Mathematik, Coding und Wissenschaft bei niedrigen Kosten.
    • Bot wählbare Denk-Aufwandsstufen (niedrig, mittel, hoch).

    Reihe o-Serie

  22. GPT-4.5 Sprache

    • OpenAIs größtes klassisch vortrainiertes Modell, mit breiterem Weltwissen und weniger Halluzinationen.
    • Galt als letzter großer Schritt der reinen Pretraining-Skalierung und zeigte deren abnehmenden Ertrag.
    • Blieb trotz angenehmerem Ton bei Mathe und Code hinter den Reasoning-Modellen zurück und wurde bald abgelöst.

    Reihe GPT

  23. GPT Image 1 Bild

    • Native Bilderzeugung direkt im GPT-4o, löste den Ghibli-Hype aus.
    • Sehr starke Prompt-Treue, Textwiedergabe und Bildbearbeitung im Chat.
    • Machte präzises, mehrstufiges Bild-Editing per Dialog massentauglich.

    Reihe DALL-E

  24. o3 Sprache

    • Reasoning-Modelle o3 und o4-mini, die erstmals während des Denkens selbstständig Werkzeuge nutzen.
    • Sie denken mit Bildern, zoomen und analysieren also visuelle Inhalte als Teil der Schlussfolgerung.
    • Web-Suche, Python und Bildverarbeitung im Reasoning-Loop machten echte agentische Aufgaben möglich.

    Reihe o-Serie

  25. GPT-4.1 Code

    • API-Modellreihe mit starkem Fokus auf Programmierung.
    • Bot bis zu 1 Million Token Kontext und bessere Instruktionstreue.
    • Kam in den Größen Standard, mini und nano.

    Reihe GPT

  26. o4-mini Multimodal

    • Kompaktes Reasoning-Modell, das auch mit Bildern denken kann.
    • Konnte Werkzeuge wie Websuche und Python im Denkprozess nutzen.
    • Bot starke Mathematik- und Coding-Leistung sehr effizient.

    Reihe o-Serie

  27. GPT-5 Multimodal

    • Vereintes System, das selbst entscheidet, wann es schnell antwortet und wann es länger nachdenkt.
    • Deutlich seltener Halluzinationen und Spitzenwerte bei Code, Mathe und multimodalem Verständnis.
    • Löste GPT-4o als Standardmodell von ChatGPT ab und brachte 400.000 Tokens Kontext.

    Reihe GPT

  28. gpt-oss Sprache

    • OpenAIs erste offene Gewichte seit GPT-2 (gpt-oss-120b und 20b).
    • Reasoning-Modelle mit einstellbarem Denkaufwand, Apache 2.0.
    • 120b lief auf einer 80-GB-GPU, 20b auf Consumer-Hardware.

  29. Sora 2 Video

    • Nachfolger von Sora mit physikalisch realistischeren Clips und synchronem Dialog und Soundeffekten.
    • Erschien zusammen mit einer eigenen Social-App, die KI-Videos zum Massenphänomen machte.
    • Erlaubt Cameos, also das kontrollierte Einsetzen echter Personen in generierte Szenen.

    Reihe Sora

  30. GPT-5.1 Sprache

    • Aktualisierung von GPT-5 mit wärmerem, gesprächigerem Ton.
    • Erschien in den Varianten Instant und Thinking.
    • Passte die Denkzeit adaptiv an die Schwierigkeit der Aufgabe an.

    Reihe GPT

  31. GPT-5.2 Sprache

    • Frontier-Modell für berufliche Arbeit und langlaufende Agenten, stark bei Tabellen, Präsentationen, Code und langen Kontexten.
    • Übertrifft im GDPval-Benchmark Fachleute bei gut definierten Wissensaufgaben aus 44 Berufen.
    • Erschien am 11. Dezember 2025 in drei Modi: Instant, Thinking und Pro.

    Reihe GPT

  32. GPT-5.2-Codex Code

    • Agentisches Coding-Modell für den Codex-Agenten, zeitgleich mit GPT-5.2 veröffentlicht.
    • Optimiert für Codegenerierung, Fehlersuche und lange Entwickler-Workflows.

    Reihe GPT

  33. GPT-5.3-Codex Code

    • Bis dahin fähigstes agentisches Coding-Modell: vereint den Codex- und den GPT-5-Trainingsstack und arbeitet rund 25 Prozent schneller.
    • Spitzenwerte auf SWE-Bench Pro und Terminal-Bench 2.0.

    Reihe GPT

  34. GPT-5.3-Codex-Spark Code

    • Kleinere Echtzeit-Variante von GPT-5.3-Codex mit über 1000 Tokens pro Sekunde auf Cerebras-Hardware.
    • Erster Meilenstein der Partnerschaft von OpenAI und Cerebras.

    Reihe GPT

  35. GPT-5.4 Sprache

    • Frontier-Modell mit integrierter Computernutzung und 75 Prozent auf OSWorld-Verified, dazu eine verbesserte Deep-Research-Funktion.
    • Rund 33 Prozent weniger Faktenfehler als GPT-5.2; erschien am 5. März 2026, mini und nano folgten am 17. März.

    Reihe GPT

  36. GPT-5.5 Multimodal

    • OpenAIs agentisches Flagship, das mehrstufige Aufgaben selbstständig über viele Werkzeuge hinweg erledigt.
    • Besonders stark bei agentischem Coding, Computer-Nutzung und früher wissenschaftlicher Recherche.
    • Erholt sich besser von Fehlern mitten in der Aufgabe und hält Kohärenz über lange Kontexte.

    Reihe GPT

  37. GPT Image 2 Bild

    • Bildmodell mit nahezu perfektem Textrendering, auch für Chinesisch, Japanisch, Koreanisch, Hindi und Bengali.
    • Bis zu 4K-Auflösung und Reasoning-gestützte Erzeugung; löst DALL-E 3 ab und belegte binnen zwölf Stunden Platz 1 aller Kategorien der Image Arena.

    Reihe DALL-E

  38. GPT-Rosalind Grundlagen

    • Erstes vertikales OpenAI-Modell für die Life-Sciences-Forschung, mit biologischem Reasoning, Medizinalchemie und Genomik-Analyse.
    • Nur über ein Trusted-Access-Programm verfügbar.

  39. GPT-Realtime-2 Audio

    • API-Sprachmodell mit dem Reasoning der GPT-5-Reihe, erstmals mit per Anweisung steuerbarem Sprechstil.
    • Zusammen mit GPT-Realtime-Translate (Live-Übersetzung aus über 70 Sprachen) und GPT-Realtime-Whisper (streamende Transkription) veröffentlicht.

  40. GPT-5.6 (Sol, Terra, Luna) Multimodal

    • Neue Frontier-Familie in drei Stufen: Sol als Flaggschiff, Terra als günstigere Mittelklasse, Luna als schnellstes und billigstes Modell.
    • Terra erreicht das Niveau von GPT-5.5 zum halben Preis; Sol arbeitet beim agentischen Programmieren rund 54 Prozent token-effizienter.
    • Nach eingeschränkter Vorschau ab dem 26. Juni am 9. Juli 2026 allgemein in ChatGPT, Codex und der API freigegeben.

    Reihe GPT

  41. GPT-Live-1 Audio

    • Voll-duplexes Sprachmodell: hört und spricht gleichzeitig, erlaubt natürliches Unterbrechen und Live-Übersetzung.
    • Löst den bisherigen Advanced Voice Mode in ChatGPT ab und reicht schwere Anfragen im Hintergrund an das Frontier-Modell weiter.