DeepSeek V4 GA
Preise, Architektur & Vergleich mit GPT-5.6

Zeitachse · CSA+HCA · Benchmark-Tabellen · Peak-Preise · API-Migration · Stichtag 24.7.

DeepSeek V4 GA Vollversion Release Juli 2026
Nach drei Monaten Preview ist DeepSeek V4 General Availability (GA) am 20. Juli 2026 live. Die Vollversion bringt Agent-Fähigkeiten, stärkeres mathematisches Reasoning und gezielte Code-Generierung — erstmals mit Peak-Off-Peak-Preisen. Wer noch deepseek-chat nutzt, GPT-5.6 und Claude Fable 5 kostenmäßig vergleichen oder die API-Migration vor dem 24.-Juli-Stichtag abschließen will, erhält hier: ① die komplette Preview-zu-GA-Zeitachse; ② wie CSA+HCA 1 Million Token Kontext trägt; ③ Benchmark-Scores, Peak-Preistabellen und ein Sechs-Schritte-Migrations-Runbook — inklusive DSGVO-relevanter Hinweise bei Cloud-API und Self-Hosting.
01

Was liefert DeepSeek V4 GA? Zeitachse von der Preview zur Vollversion

Am 20. Juli 2026 erreichte DeepSeek V4 General Availability. Die MoE-Architektur ist nicht neu — sie wurde am 24. April unter MIT open sourced —, aber GA ist die Abschlussversion: Stabilität, Performance-Tuning und ein formales Abrechnungssystem. Die Vollversion stärkt Agent-Workflows, mathematisches Reasoning und Code-Generierung und markiert DeepSeeks Übergang von nahezu kostenloser Nutzung zu disziplinierter kommerzieller Betriebsführung.

DatumEreignis
2026-04-24V4-Preview + MIT-Open-Source: V4-Pro (1,6T) und V4-Flash (284B)
2026-05Produktionsoptimierte V4-Flash- und V4-Pro-Versionen; API allgemein verfügbar
2026-06V4-Pro-Outputpreis dauerhaft um 75 % gesenkt ($0,87/M Tokens)
2026-06-29E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Peak-Off-Peak-Preise
2026-07-19Ausgewählte Entwickler erhalten GA-Grauzugang
2026-07-20GA-Produktionsrelease (Publikationsdatum dieses Artikels)
2026-07-24Legacy-Endpunkte deepseek-chat und deepseek-reasoner dauerhaft abgeschaltet
01

Migrationsdruck: Legacy-Modellnamen deepseek-chat / deepseek-reasoner antworten ab 24.7. 23:59 Uhr Peking-Zeit nicht mehr. Produktionssysteme haben vier Tage zum Wechsel.

02

Abrechnungskomplexität: GA führt erstmals Peak-Off-Peak-Preise ein. Werktags verdoppeln sich die Tarife 09:00–12:00 und 14:00–18:00 Peking-Zeit — 24/7-Pipelines brauchen neue Zeitplanung.

03

Leistungserwartung: GA schlägt Claude Fable 5 oder GPT-5.6 Ultra nicht überall, liefert aber die stärkste Open-Source-Performance zu 1/10 bis 1/100 der Kosten.

04

Self-Hosting-Hürde: Trotz MIT-Lizenz verlangt V4-Pro mit 1,6T Parametern ernsthafte Hardware. Die meisten Teams bleiben bei API oder Cloud-Mac-Inferenzknoten — letzteres relevant für DSGVO-konforme Verarbeitung in EU-Rechenzentren.

05

Wettbewerb mit Kimi K3: Kimi K3 jagt Skalerekorde mit 2,8T Parametern; DeepSeek verteidigt seine Entwicklerbasis mit Preisen und reifem API-Ökosystem.

02

DeepSeek-V4-Architektur und vollständige Benchmark-Tabelle

DeepSeek V4 verlässt die Multi-head Latent Attention (MLA) aus V2/V3 zugunsten eines Hybrid aus CSA (Compressed Sparse Attention) und HCA (Heavily Compressed Attention). Bei 1M Token sinkt der KV-Cache-Speicher auf nur 10 % von V3.2 (7 % bei V4-Flash), Inferenz-FLOPs auf 27 %. mHC (manifold-constrained hyper-connections) stabilisiert das 61-schichtige Netz über vier Residual-Kanäle; Training nutzt den Muon-Optimierer statt AdamW.

SpezifikationV4-ProV4-Flash
Gesamtparameter1,6 Billionen (1,6T)284 Milliarden (284B)
Aktiv pro Token49 Milliarden (49B)13 Milliarden (13B)
Transformer-Schichten6143
Kontextfenster1.000.000 Token1.000.000 Token
Max. Output384K Token384K Token
PräzisionFP4 (Experten) + FP8FP4 + FP8 gemischt
Pretraining-Daten33T+ Token32T+ Token
LizenzMITMIT

Drei Reasoning-Modi: Non-think (schnellste, ohne Chain-of-Thought), Think High (explizites Reasoning, ideal für Code-Debugging), Think Max (maximale Reasoning-Tiefe, braucht 384K+ Kontext für komplexe Mathematik und lange Agent-Ketten). Offizielle Sampling-Defaults: temperature=1.0, top_p=1.0.

BenchmarkDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80,6 % ★ Open-Source-Bestwert96,0 %nicht separat veröffentlicht~69 %
SWE-bench Pro55,4 %80,3 %78,1 %69,2 %
LiveCodeBench (Pass@1)93,5 %88,1 %87,4 %83,2 %
Codeforces Elo3.206
Terminal-Bench 2.183,9 %88,0 %85,1 %82,7 %

Artificial-Analysis-Daten: Claude Fable 5 kostet $3,48 pro Strategy-&-Ops-Aufgabe (50 Punkte); DeepSeek V4-Pro $0,03 (38 Punkte) — 116× Kostenunterschied bei etwa 12 Punkten Abstand.

03

DeepSeek V4 vs. GPT-5.6 Sol und Claude Fable 5: Was wählen?

DimensionDeepSeek V4-ProGPT-5.6 SolClaude Fable 5
Open Source / Self-Host✅ MIT❌ geschlossen❌ geschlossen
Kontextfenster1M Tokennicht öffentlich1M Token
Code-Fähigkeitsehr stark (nahe Fable 5)sehr starkstärkste (SWE-bench Pro 80,3 %)
API-Output (Off-Peak)$0,87/M~$15/M~$50/M
Peak-Outputpreis$1,74/M
Agent-Fähigkeitstark, Multi-Agent-Orchestrierungstarkstärkste
Datenschutz✅ on-premises deploybar (DSGVO)

Knappes Budget / hohe Aufrufhäufigkeit / private Bereitstellung → V4-Pro oder V4-Flash; maximale Code-Qualität, Kosten egal → Claude Fable 5; komplexe Algorithmen + Mathe-Reasoning → GPT-5.6 Sol / Ultra; massive Log-/Dokumentverarbeitung → V4-Flash (Cache-Treffer-Input nur $0,0028/M). Bei personenbezogenen Daten in der EU: Self-Hosting oder EU-Bare-Metal bevorzugen — Cloud-API-Prompts können Drittlandübermittlung auslösen.

04

Peak-Off-Peak-Preise: Kosten sparen und Sechs-Schritte-API-Migrations-Runbook (Stichtag 24.7.)

ModellAbrechnungspositionOff-PeakPeak
V4-ProInput (Cache-Treffer)¥0,025 / $0,0035 / 1M2× Tarif
Input (Cache-Miss)¥3,00 / $0,435 / 1M¥6,00 / $0,87
Output¥6,00 / $0,87 / 1M¥12,00 / $1,74
V4-FlashInput (Cache-Treffer)¥0,02 / $0,0028 / 1M2× Tarif
Input (Cache-Miss)¥1,00 / $0,14 / 1M¥2,00 / $0,28
Output¥2,00 / $0,28 / 1M¥4,00 / $0,56

Peak-Zeiten (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00. Selbst im Peak bleibt V4-Pro-Output ($1,74/M) 8,6× günstiger als Claude Opus 4.8 ($15/M).

Python
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

Stichtag-Warnung: deepseek-chatdeepseek-v4-flash (ohne Thinking); deepseek-reasonerdeepseek-v4-flash (Thinking-Modus) oder deepseek-v4-pro. Legacy-Namen funktionieren nach dem 24.7. 15:59 UTC nicht mehr.

01

Gesamte Codebasis durchsuchen: Alle Referenzen zu deepseek-chat und deepseek-reasoner finden — inklusive Umgebungsvariablen und Konfigurationsdateien.

02

Migrationsziele festlegen: Leichtes Chat → deepseek-v4-flash; komplexes Reasoning → deepseek-v4-pro mit Thinking-Parametern.

03

In Staging validieren: Modellnamen in der Vorproduktion wechseln, Regressionstests laufen lassen, Output-Qualität prüfen.

04

Prompt-Cache konfigurieren: Feste System-Prompts an den Anfang der Nachrichtenfolge setzen, um Cache-Treffer zu maximieren (Flash Cache-Treffer $0,0028/M).

05

Batch-Jobs Off-Peak planen: Dokumentverarbeitung, Code-Review und andere nicht-echtzeitfähige Aufgaben nach 18:00 oder vor 09:00 Peking-Zeit routen.

06

Produktions-Rollout: Vollständigen Cutover vor dem 23.7. abschließen, 24-Stunden-Rollback-Fenster einplanen. DeepSeek-Abrechnungs-E-Mails beobachten.

05

Lohnt sich DeepSeek V4 GA? Zitierbare Harddaten

A

CSA-Kompressionsverhältnis: KV-Sequenzen durch Softmax-gated Pooling 4× komprimiert; V4-Pro top-1024 / V4-Flash top-512 Sparse-Auswahl plus 128-Token-Sliding-Window.

B

HCA-Global-Attention: Token 128× komprimiert vor globaler dichter Attention; CSA und HCA wechseln sich ab, um Langstrecken-Abhängigkeiten effizient zu erfassen.

C

Kostenanker: V4-Flash bleibt in sechs Index-Aufgabenkategorien unter $0,04 pro Lauf; V4-Pro-Output bei $0,87/M ist der dauerhafte Preis nach der 75-%-Senkung im Juni.

DeepSeek V4 GA ist einer der wichtigsten Meilensteine im Open-Source-KI-Bereich 2026. Der Wert liegt nicht darin, geschlossene Flaggschiffe in jedem Benchmark zu schlagen — sondern die stärkste Open-Performance zu einem Bruchteil der Kosten zu liefern. Für Unternehmen, die keine Daten ins Ausland senden dürfen (DSGVO Art. 44 ff.), Indie-Entwickler mit knappem Budget und Agent-Ingenieure mit 1M-Token-Kontext ist V4-Pro die ausgewogenste Wahl.

Wer V4-Flash lokal oder in der Cloud für Agent-Routing und Inferenz-Splitting selbst hosten will, kommt mit einem Consumer-Mac und 16 GB RAM nicht weit — die ds4-Lokalinferenz-Dokumentation zeigt: V4-Flash braucht mindestens 96 GB Unified Memory. Reine API-Nutzung hat keine Hardware-Hürde, aber Hochfrequenz-Agent-Pipelines verlangen Host-Stabilität und 7×24-Betrieb: selbstgebaute VPS fehlt Metal-Beschleunigung, Swap-Jitter verursacht Inferenz-Timeouts. Für stabilere Produktionsumgebungen bei iOS-CI/CD und KI-Agent-Automatisierung ist MESHLAUNCH Mac-Mini-Cloud-Miete meist der bessere Weg: dediziertes Apple Silicon, Upgrade auf 64 GB+ Unified Memory nach Bedarf, 7×24 online, flexible Tages-/Wochen-/Monatsmiete. Kapazität und Regionen: Mietpreise; Ersthelfer und SLAs: Hilfezentrum.

FAQ

Werktags Peking-Zeit 09:00–12:00 und 14:00–18:00 sind Peak-Stunden mit verdoppelten Tarifen. Batch-Jobs nach 18:00 laufen günstiger. Cloud-Inferenzknoten: Mietpreise.

24.7.2026 um 15:59 UTC (23:59 Peking-Zeit) dauerhaft offline. Migration auf deepseek-v4-flash oder deepseek-v4-pro vor diesem Stichtag.

Pro für komplexes Reasoning und Agents; Flash für leichtes Routing mit Cache-Treffer-Input $0,0028/M. Lokale Deployment-Anforderungen: Hilfezentrum.

Fable 5 führt bei den härtesten Benchmarks weiter. V4-Pro erreicht mit 80,6 % auf SWE-bench Verified den Open-Source-Rekord — Output-Preis ca. 1/17 von GPT-5.6 Sol.

Ja. V4 unterstützt OpenAI ChatCompletions und Anthropic Messages. base_url bleibt https://api.deepseek.com, nur den model-Parameter aktualisieren. Bei DSGVO-relevanten Prompts Auftragsverarbeitung und Drittlandtransfer prüfen.