deepseek-chat nutzt, GPT-5.6 und Claude Fable 5 kostenmäßig vergleichen oder die API-Migration vor dem 24.-Juli-Stichtag abschließen will, erhält hier: ① die komplette Preview-zu-GA-Zeitachse; ② wie CSA+HCA 1 Million Token Kontext trägt; ③ Benchmark-Scores, Peak-Preistabellen und ein Sechs-Schritte-Migrations-Runbook — inklusive DSGVO-relevanter Hinweise bei Cloud-API und Self-Hosting.
Was liefert DeepSeek V4 GA? Zeitachse von der Preview zur Vollversion
Am 20. Juli 2026 erreichte DeepSeek V4 General Availability. Die MoE-Architektur ist nicht neu — sie wurde am 24. April unter MIT open sourced —, aber GA ist die Abschlussversion: Stabilität, Performance-Tuning und ein formales Abrechnungssystem. Die Vollversion stärkt Agent-Workflows, mathematisches Reasoning und Code-Generierung und markiert DeepSeeks Übergang von nahezu kostenloser Nutzung zu disziplinierter kommerzieller Betriebsführung.
| Datum | Ereignis |
|---|---|
| 2026-04-24 | V4-Preview + MIT-Open-Source: V4-Pro (1,6T) und V4-Flash (284B) |
| 2026-05 | Produktionsoptimierte V4-Flash- und V4-Pro-Versionen; API allgemein verfügbar |
| 2026-06 | V4-Pro-Outputpreis dauerhaft um 75 % gesenkt ($0,87/M Tokens) |
| 2026-06-29 | E-Mail an alle API-Nutzer: GA Mitte Juli, erstmals Peak-Off-Peak-Preise |
| 2026-07-19 | Ausgewählte Entwickler erhalten GA-Grauzugang |
| 2026-07-20 | GA-Produktionsrelease (Publikationsdatum dieses Artikels) |
| 2026-07-24 | Legacy-Endpunkte deepseek-chat und deepseek-reasoner dauerhaft abgeschaltet |
Migrationsdruck: Legacy-Modellnamen deepseek-chat / deepseek-reasoner antworten ab 24.7. 23:59 Uhr Peking-Zeit nicht mehr. Produktionssysteme haben vier Tage zum Wechsel.
Abrechnungskomplexität: GA führt erstmals Peak-Off-Peak-Preise ein. Werktags verdoppeln sich die Tarife 09:00–12:00 und 14:00–18:00 Peking-Zeit — 24/7-Pipelines brauchen neue Zeitplanung.
Leistungserwartung: GA schlägt Claude Fable 5 oder GPT-5.6 Ultra nicht überall, liefert aber die stärkste Open-Source-Performance zu 1/10 bis 1/100 der Kosten.
Self-Hosting-Hürde: Trotz MIT-Lizenz verlangt V4-Pro mit 1,6T Parametern ernsthafte Hardware. Die meisten Teams bleiben bei API oder Cloud-Mac-Inferenzknoten — letzteres relevant für DSGVO-konforme Verarbeitung in EU-Rechenzentren.
Wettbewerb mit Kimi K3: Kimi K3 jagt Skalerekorde mit 2,8T Parametern; DeepSeek verteidigt seine Entwicklerbasis mit Preisen und reifem API-Ökosystem.
DeepSeek-V4-Architektur und vollständige Benchmark-Tabelle
DeepSeek V4 verlässt die Multi-head Latent Attention (MLA) aus V2/V3 zugunsten eines Hybrid aus CSA (Compressed Sparse Attention) und HCA (Heavily Compressed Attention). Bei 1M Token sinkt der KV-Cache-Speicher auf nur 10 % von V3.2 (7 % bei V4-Flash), Inferenz-FLOPs auf 27 %. mHC (manifold-constrained hyper-connections) stabilisiert das 61-schichtige Netz über vier Residual-Kanäle; Training nutzt den Muon-Optimierer statt AdamW.
| Spezifikation | V4-Pro | V4-Flash |
|---|---|---|
| Gesamtparameter | 1,6 Billionen (1,6T) | 284 Milliarden (284B) |
| Aktiv pro Token | 49 Milliarden (49B) | 13 Milliarden (13B) |
| Transformer-Schichten | 61 | 43 |
| Kontextfenster | 1.000.000 Token | 1.000.000 Token |
| Max. Output | 384K Token | 384K Token |
| Präzision | FP4 (Experten) + FP8 | FP4 + FP8 gemischt |
| Pretraining-Daten | 33T+ Token | 32T+ Token |
| Lizenz | MIT | MIT |
Drei Reasoning-Modi: Non-think (schnellste, ohne Chain-of-Thought), Think High (explizites Reasoning, ideal für Code-Debugging), Think Max (maximale Reasoning-Tiefe, braucht 384K+ Kontext für komplexe Mathematik und lange Agent-Ketten). Offizielle Sampling-Defaults: temperature=1.0, top_p=1.0.
| Benchmark | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80,6 % ★ Open-Source-Bestwert | 96,0 % | nicht separat veröffentlicht | ~69 % |
| SWE-bench Pro | 55,4 % | 80,3 % | 78,1 % | 69,2 % |
| LiveCodeBench (Pass@1) | 93,5 % | 88,1 % | 87,4 % | 83,2 % |
| Codeforces Elo | 3.206 | — | — | — |
| Terminal-Bench 2.1 | 83,9 % | 88,0 % | 85,1 % | 82,7 % |
Artificial-Analysis-Daten: Claude Fable 5 kostet $3,48 pro Strategy-&-Ops-Aufgabe (50 Punkte); DeepSeek V4-Pro $0,03 (38 Punkte) — 116× Kostenunterschied bei etwa 12 Punkten Abstand.
DeepSeek V4 vs. GPT-5.6 Sol und Claude Fable 5: Was wählen?
| Dimension | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| Open Source / Self-Host | ✅ MIT | ❌ geschlossen | ❌ geschlossen |
| Kontextfenster | 1M Token | nicht öffentlich | 1M Token |
| Code-Fähigkeit | sehr stark (nahe Fable 5) | sehr stark | stärkste (SWE-bench Pro 80,3 %) |
| API-Output (Off-Peak) | $0,87/M | ~$15/M | ~$50/M |
| Peak-Outputpreis | $1,74/M | — | — |
| Agent-Fähigkeit | stark, Multi-Agent-Orchestrierung | stark | stärkste |
| Datenschutz | ✅ on-premises deploybar (DSGVO) | ❌ | ❌ |
Knappes Budget / hohe Aufrufhäufigkeit / private Bereitstellung → V4-Pro oder V4-Flash; maximale Code-Qualität, Kosten egal → Claude Fable 5; komplexe Algorithmen + Mathe-Reasoning → GPT-5.6 Sol / Ultra; massive Log-/Dokumentverarbeitung → V4-Flash (Cache-Treffer-Input nur $0,0028/M). Bei personenbezogenen Daten in der EU: Self-Hosting oder EU-Bare-Metal bevorzugen — Cloud-API-Prompts können Drittlandübermittlung auslösen.
Peak-Off-Peak-Preise: Kosten sparen und Sechs-Schritte-API-Migrations-Runbook (Stichtag 24.7.)
| Modell | Abrechnungsposition | Off-Peak | Peak |
|---|---|---|---|
| V4-Pro | Input (Cache-Treffer) | ¥0,025 / $0,0035 / 1M | 2× Tarif |
| Input (Cache-Miss) | ¥3,00 / $0,435 / 1M | ¥6,00 / $0,87 | |
| Output | ¥6,00 / $0,87 / 1M | ¥12,00 / $1,74 | |
| V4-Flash | Input (Cache-Treffer) | ¥0,02 / $0,0028 / 1M | 2× Tarif |
| Input (Cache-Miss) | ¥1,00 / $0,14 / 1M | ¥2,00 / $0,28 | |
| Output | ¥2,00 / $0,28 / 1M | ¥4,00 / $0,56 |
Peak-Zeiten (Peking-Zeit): Werktags 09:00–12:00 und 14:00–18:00. Selbst im Peak bleibt V4-Pro-Output ($1,74/M) 8,6× günstiger als Claude Opus 4.8 ($15/M).
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
Stichtag-Warnung: deepseek-chat → deepseek-v4-flash (ohne Thinking); deepseek-reasoner → deepseek-v4-flash (Thinking-Modus) oder deepseek-v4-pro. Legacy-Namen funktionieren nach dem 24.7. 15:59 UTC nicht mehr.
Gesamte Codebasis durchsuchen: Alle Referenzen zu deepseek-chat und deepseek-reasoner finden — inklusive Umgebungsvariablen und Konfigurationsdateien.
Migrationsziele festlegen: Leichtes Chat → deepseek-v4-flash; komplexes Reasoning → deepseek-v4-pro mit Thinking-Parametern.
In Staging validieren: Modellnamen in der Vorproduktion wechseln, Regressionstests laufen lassen, Output-Qualität prüfen.
Prompt-Cache konfigurieren: Feste System-Prompts an den Anfang der Nachrichtenfolge setzen, um Cache-Treffer zu maximieren (Flash Cache-Treffer $0,0028/M).
Batch-Jobs Off-Peak planen: Dokumentverarbeitung, Code-Review und andere nicht-echtzeitfähige Aufgaben nach 18:00 oder vor 09:00 Peking-Zeit routen.
Produktions-Rollout: Vollständigen Cutover vor dem 23.7. abschließen, 24-Stunden-Rollback-Fenster einplanen. DeepSeek-Abrechnungs-E-Mails beobachten.
Lohnt sich DeepSeek V4 GA? Zitierbare Harddaten
CSA-Kompressionsverhältnis: KV-Sequenzen durch Softmax-gated Pooling 4× komprimiert; V4-Pro top-1024 / V4-Flash top-512 Sparse-Auswahl plus 128-Token-Sliding-Window.
HCA-Global-Attention: Token 128× komprimiert vor globaler dichter Attention; CSA und HCA wechseln sich ab, um Langstrecken-Abhängigkeiten effizient zu erfassen.
Kostenanker: V4-Flash bleibt in sechs Index-Aufgabenkategorien unter $0,04 pro Lauf; V4-Pro-Output bei $0,87/M ist der dauerhafte Preis nach der 75-%-Senkung im Juni.
DeepSeek V4 GA ist einer der wichtigsten Meilensteine im Open-Source-KI-Bereich 2026. Der Wert liegt nicht darin, geschlossene Flaggschiffe in jedem Benchmark zu schlagen — sondern die stärkste Open-Performance zu einem Bruchteil der Kosten zu liefern. Für Unternehmen, die keine Daten ins Ausland senden dürfen (DSGVO Art. 44 ff.), Indie-Entwickler mit knappem Budget und Agent-Ingenieure mit 1M-Token-Kontext ist V4-Pro die ausgewogenste Wahl.
Wer V4-Flash lokal oder in der Cloud für Agent-Routing und Inferenz-Splitting selbst hosten will, kommt mit einem Consumer-Mac und 16 GB RAM nicht weit — die ds4-Lokalinferenz-Dokumentation zeigt: V4-Flash braucht mindestens 96 GB Unified Memory. Reine API-Nutzung hat keine Hardware-Hürde, aber Hochfrequenz-Agent-Pipelines verlangen Host-Stabilität und 7×24-Betrieb: selbstgebaute VPS fehlt Metal-Beschleunigung, Swap-Jitter verursacht Inferenz-Timeouts. Für stabilere Produktionsumgebungen bei iOS-CI/CD und KI-Agent-Automatisierung ist MESHLAUNCH Mac-Mini-Cloud-Miete meist der bessere Weg: dediziertes Apple Silicon, Upgrade auf 64 GB+ Unified Memory nach Bedarf, 7×24 online, flexible Tages-/Wochen-/Monatsmiete. Kapazität und Regionen: Mietpreise; Ersthelfer und SLAs: Hilfezentrum.
Werktags Peking-Zeit 09:00–12:00 und 14:00–18:00 sind Peak-Stunden mit verdoppelten Tarifen. Batch-Jobs nach 18:00 laufen günstiger. Cloud-Inferenzknoten: Mietpreise.
24.7.2026 um 15:59 UTC (23:59 Peking-Zeit) dauerhaft offline. Migration auf deepseek-v4-flash oder deepseek-v4-pro vor diesem Stichtag.
Pro für komplexes Reasoning und Agents; Flash für leichtes Routing mit Cache-Treffer-Input $0,0028/M. Lokale Deployment-Anforderungen: Hilfezentrum.
Fable 5 führt bei den härtesten Benchmarks weiter. V4-Pro erreicht mit 80,6 % auf SWE-bench Verified den Open-Source-Rekord — Output-Preis ca. 1/17 von GPT-5.6 Sol.
Ja. V4 unterstützt OpenAI ChatCompletions und Anthropic Messages. base_url bleibt https://api.deepseek.com, nur den model-Parameter aktualisieren. Bei DSGVO-relevanten Prompts Auftragsverarbeitung und Drittlandtransfer prüfen.