Was am 31. Juli tatsächlich lieferte — und was nicht
„DeepSeek V4 offiziell" klingt nach einem neuen Modell. Ist es nicht. Der 31.-Juli-Schritt ist ein Post-Training-Refresh auf demselben Flash-Skelett. Flagship V4-Pro GA und das hauseigene Harness-Agent-Framework bleiben ohne festes Datum unveröffentlicht.
Kein Scale-up: DeepSeek erklärt die Gewinne ausschließlich durch Post-Training, nicht durch Parameterwachstum — ein 284B/13B Flash schlägt jetzt ein 1,6T/49B Pro-Preview bei mehreren Agent-Aufgaben.
Nur API-Rollout: Der offizielle Build ist ausschließlich API-Public-Beta; Consumer-App und Web-Chat wurden nicht aktualisiert.
Legacy-Aliase abgeschaltet: deepseek-chat und deepseek-reasoner endeten am 24. Juli — nicht migrierte Pipelines brechen hart ab.
Wettbewerbsdruck: Moonshots Kimi K3 (2,8T Open Weights) landete am 27. Juli, Tage vor DeepSeeks Flash-Promotion.
Pro-GA weiter vage: Chinesische Foren spotteten über „leere Versprechen" vor dem Flash-Überraschungsmove; V4-Pro-Offiziell-Timing bleibt unbestätigt.
| Datum | Ereignis |
|---|---|
| 24.4.2026 | V4-Preview: V4-Pro (1,6T/49B) + V4-Flash (284B/13B), 1M Kontext, MIT-Weights |
| 24.7.2026 | Legacy-Modellnamen abgeschaltet; Traffic routet zur V4-Familie |
| 27.7.2026 | Kimi K3 2,8T Weights auf Hugging Face |
| 31.7.2026 | V4-Flash-0731 offizielle API-Beta + Weights; Changelog nennt Harness „coming soon" |
| 5.8.2026 | V4-Pro GA weiter „so bald wie möglich"; Aug 10–20-Fenster sind unbestätigte Gerüchte |
DeepSeek V4-Flash-Preise vs. Kimi K3 und Qwen3.8-Max
| Modell | Status | Gesamt / Aktiv | Kontext | Input miss/hit ($/1M) | Output ($/1M) | Lizenz |
|---|---|---|---|---|---|---|
| V4-Flash-0731 | Offiziell 31.7. | 284B / 13B | 1M | $0,14 / $0,0028 | $0,28 | MIT |
| V4-Pro | Preview | 1,6T / 49B | 1M | $0,435 / $0,003625 | $0,87 | MIT |
| Kimi K3 | Weights 27.7. | 2,8T / ~104B gesch. | ~1,05M | $3,00 / $0,30 | $15,00 | Modified MIT |
| GLM-5.2 | Open Jun 2026 | ~744B / ~40B | 1M | Hier nicht verifiziert | Nicht verifiziert | MIT |
| Qwen3.8-Max | API GA 2.8. | 2,4T / 95B | 1M | $2,00 / ~$0,17–0,25 | $6,00 | Weights angekündigt |
Alle Angaben sind herstellerseitig veröffentlichte Listenpreise. DeepSeek kündigte einen künftigen 2×-Peak-Hour-Zuschlag (9–12 Uhr und 14–18 Uhr Peking-Zeit) ohne Wirksamkeitsdatum an. Unser V4-GA-Breakdown vom 20. Juli deckt die frühere GA-Narrative ab; dieser Artikel fokussiert den offiziellen Flash-Build vom 31. Juli.
Herstellerrechnung vs. Claude Opus 4.8: etwa 36× bei Cache-Miss-Input, 179× bei Cache-Hit-Input, 89× bei Output — Listenpreise, keine geprüften Gesamtkosten.
Mehr aus demselben Modell: Post-Training, CSA+HCA, Harness
V4-Flash-0731 ist in Größe und Struktur identisch mit dem April-Preview. DeepSeek führt den Agent-Benchmark-Sprung ausschließlich auf einen frischen Post-Training-Pass zurück — gegen die Standardannahme „größer gleich besser" im Modellrennen 2026.
Hybrid CSA+HCA Attention: Compressed Sparse Attention plus Heavily Compressed Attention, als DSA vermarktet, senkt Compute und Speicher bei langem Kontext.
mHC Hyper-Connections: Manifold-Constrained Hyper-Connections verfeinern Residual-Pfade für Stabilität.
Muon-Optimizer: Ersetzt klassische Optimizer; DeepSeek behauptet bei 1M Tokens braucht V4-Pro 27 % der V3.2 Per-Token-FLOPs und 10 % KV-Cache.
Der 31. Juli markierte auch die erste offizielle Erwähnung von DeepSeek Harness — einem hauseigenen Agent-Runner gegen Claude Code. Jeder Agent-Score, den DeepSeek für Flash-0731 veröffentlichte (Terminal Bench 2.0, Toolathlon usw.), nutzte den Harness-Minimalmodus, der noch nicht öffentlich ist. Das Changelog warnt selbst, Agent-Scores seien „extrem sensitiv gegenüber Harness-Wahl".
Hinweis: Terminal Bench 2.0 Hersteller-Score: Flash-0731 82,7 vs. V4-Pro-Preview 67,9 — max effort, top_p 0,95, temperature 1,0, Harness-Minimalmodus.
Chinas Open-Weight-Markt: Artificial-Analysis-Index und Sechs-Schritte-Runbook
| Modell | Lab | Intelligence Index | Kosten pro Aufgabe (AA) | Anmerkung |
|---|---|---|---|---|
| V4-Flash-0731 | DeepSeek | 50 | $0,03 | Offiziell 31.7. |
| Kimi K3 | Moonshot | 57 | $0,86 | Höherer Index, ~29× Kosten |
| GLM-5.2 | Zhipu | ~1 Pkt. über Flash | Nicht verifiziert | Open Jun 2026 |
| GPT-5.6 Sol | OpenAI | 9+ Pkt. darüber | $1,86 | Geschlossen |
| Claude Fable 5 | Anthropic | 9+ Pkt. darüber | $3,15 | Geschlossen |
Intelligence Index und Kosten pro Aufgabe stammen von Artificial Analysis über Finanzmedien; DeepSeeks eigene Agent-Scores nutzen andere Harnesses — die beiden Spalten nicht vermischen. DeepSeek jagt keine Leaderboard-Kronen; es optimiert für „gut genug bei einem Preis, den niemand sonst trifft" — was auch sieben Wochen OpenRouter-Spitze für das Preview erklärt.
Client konfigurieren: model auf deepseek-v4-flash setzen, base_url bei https://api.deepseek.com lassen; OpenAI- und Anthropic-SDK-Formate funktionieren beide.
Legacy-Namen bereinigen: Repos und CI nach deepseek-chat und deepseek-reasoner durchsuchen.
Staging-Regression: Modellnamen in Pre-Prod wechseln, Agent-Pipeline-Qualität, Latenz und Cache-Hit-Raten vergleichen.
Prompt-Cache maximieren: Stabile System-Prompts oben in Messages pinnen ($0,0028/M gecachter Input).
Nach Tier routen: Flash für Bulk und Routing; V4-Pro-Preview für schweres Reasoning bis offizielles GA.
Harness-GA beobachten: Changelog und Hugging Face tracken; Agent-Benchmarks nach Harness-Veröffentlichung erneut laufen lassen.
Benchmark-Einschränkungen, Kill Line und zitierfähige Harddaten
Harness-Abhängigkeit: Agent-Headline-Scores sind Hersteller plus unreleased Framework — auf Claude Code / Cursor-Reproduktionen warten.
Usability-Lücken: Feedback aus dem Ausland nennt niedrige Cache-Hit-Raten und gelegentliche Safety-Classifier-Timeouts — Compute-Obergrenzen zählen weiter.
„Kill Line" (斩杀线): Chinesischer Dev-Slang für DeepSeeks gut-genug-plus-billig-Kombo, die Rivalen zu Fähigkeit oder Preis zwingt — Kontext für GPT-5.6 Lunas 80%-Kürzung.
Nvidia, Broadcom und AMD reagierten am 31. Juli gedämpft — Märkte behandeln „DeepSeek-Effizienz" inzwischen als Routine-Engineering, anders als der R1-Chip-Selloff Anfang 2025. Berichte über eine ~7,4-Mrd.-$-Finanzierungsrunde und IPO-Vorbereitung stammen aus anonymen Finanzmedien, nicht aus regulatorischen Filings — nur Hintergrund.
V4-Flash lokal über antirez ds4 braucht 96 GB Unified Memory. Reine API-Nutzung umgeht lokale Hardware, aber hochfrequente Agent-Pipelines verlangen stabile 7×24-Hosts. Consumer-Macs und unterdimensionierte VPS-Instanzen swap-thrashen bei langem Kontext; kurze Trials stressen selten 1M-Token-Pfade. Für EU-Teams mit personenbezogenen Daten in Prompts gilt: Cloud-API-Verarbeitung außerhalb der EU erfordert eine saubere DSGVO-Grundlage (Auftragsverarbeitung, Datenminimierung); Self-Hosting oder dedizierte EU-Metal-Knoten reduzieren Transferrisiken. Für stabilere iOS-CI/CD und Agent-Automatisierung ist MESHLAUNCH Mac-Mini-Cloud-Miete meist die bessere Produktionswahl: dediziertes Apple Silicon, elastische Speichertiers, Tages-/Wochen-/Monatsabrechnung. Kapazität: Mietpreise; Setup: Hilfezentrum.
Ja. V4-Pro und V4-Flash, einschließlich Flash-0731 vom 31.7., stehen als MIT-Weights auf Hugging Face für kommerzielle Nutzung bereit. Cloud-Preise auf unserer Mietpreisseite.
Herstellerlistenpreise: etwa 36× bei Cache-Miss-Input, 179× bei Cache-Hit-Input, 89× bei Output vs. Claude Opus 4.8 pro Million Tokens.
Kein bestätigtes Datum. Changelog nennt „so bald wie möglich". Fenster 10.–20. August sind unbestätigte Gerüchte.
SWE-bench Verified und ähnliche Drittanbieter-Suites zählen mehr. Terminal Bench 2.0 nutzte unreleased Harness — als harness-spezifisch behandeln, bis anderswo reproduziert.
DeepSeeks hauseigener Agent-Runner vs. Claude Code — Dateiedits, Tool-Aufrufe, mehrstufiges Engineering. Am 31.7. benannt; noch nicht öffentlich. Cloud-Mac-Setup im Hilfezentrum.