Modellreihe · DEEPSEEK

DeepSeek

8 Releases · Nov 2023 bis Apr 2026 · im Schnitt alle 4,1 Monate

digitalpfade digitalpfa.de/zeitstrahl/modell/deepseek
DeepSeek LLM 67B Nov 2023 DeepSeek-V2 Mai 2024 DeepSeek-V3 Dez 2024 DeepSeek R1 Jan 2025 DeepSeek-V3.1 Aug 2025 DeepSeek-V3.2-Exp Sep 2025 DeepSeek-V3.2 Dez 2025 DeepSeek-V4 Apr 2026 2024 2025 2026

Alle Releases

  1. DeepSeek LLM 67B Sprache

    • Erstes universelles LLM von DeepSeek, 7B und 67B, quelloffen.
    • 67B-Basis übertraf Llama2-70B in Reasoning, Code und Mathe.
    • Legte das Fundament für die späteren V-Modelle.

  2. DeepSeek-V2 Sprache

    • 236B-MoE mit nur 21B aktiven Parametern, sehr günstig im Betrieb.
    • Führte Multi-Head Latent Attention für kleinen KV-Cache ein.
    • Löste mit Kampfpreisen Chinas LLM-Preiskrieg aus.

  3. DeepSeek-V3 Sprache

    • 671B-MoE (37B aktiv), das mit GPT-4o und Claude 3.5 mithielt.
    • Für nur rund 5,6 Millionen Dollar trainiert, ein Effizienzschock.
    • Quelloffen und kommerziell frei nutzbar.

  4. DeepSeek R1 Sprache

    • Erstes frei verfügbares Reasoning-Modell, das mit OpenAIs o1 bei Mathe, Code und Logik gleichzog.
    • Lernte per Reinforcement Learning eigenständig Schritt-für-Schritt-Denken und Selbstkorrektur.
    • Der Schock über diese Leistung zu Bruchteilen der Kosten ließ im Januar 2025 Tech-Aktien einbrechen.

  5. DeepSeek-V3.1 Sprache

    • Hybrides Modell mit Denk- und Schnellmodus in einem System.
    • Großer Sprung bei SWE-bench und Terminal-bench gegenüber V3 und R1.
    • Auf chinesische Chips optimiert, als GPT-5-Herausforderer gehandelt.

  6. DeepSeek-V3.2-Exp Sprache

    • Experimentell mit DeepSeek Sparse Attention für lange Kontexte.
    • Senkte die API-Preise um über 50 Prozent.
    • Effizienz-Vorschau auf die nächste DeepSeek-Generation.

  7. DeepSeek-V3.2 Sprache

    • Offenes MIT-Reasoning-Modell mit 685B Parametern, das als erstes DeepSeek-Modell das Denken direkt in die Werkzeugnutzung integriert.
    • Die Speciale-Variante erreicht Gold-Niveau in Mathematik- und Programmier-Olympiaden bei stark gesenkten Kosten.

  8. DeepSeek-V4 Sprache

    • Zwei offene Modelle: V4-Pro mit 1,6 Billionen Parametern (49B aktiv) und V4-Flash mit 284B (13B aktiv), beide mit einer Million Token Kontext.
    • Eine neue Sparse-Attention senkt die Rechenlast im langen Kontext drastisch; kompatibel mit den APIs von OpenAI und Anthropic.
    • Der Preis liegt bei rund 3,48 Dollar je Million Ausgabe-Tokens, gegenüber 25 bis 30 Dollar bei den westlichen Spitzenmodellen.