Ist DeepSeek V4-Flash wirklich 100× günstiger
als Claude? Die Benchmarks im Detail

Offizieller Build 31.7. · Post-Training-Gewinne · Harness-Debüt · Kill Line · Sechs-Schritte-Runbook

DeepSeek V4-Flash-0731 offizielle Benchmarks August 2026
Am 31. Juli 2026 stufte DeepSeek V4-Flash-0731 zum offiziellen API-Build hoch: dieselbe 284B-Parameter-Architektur wie im April-Preview, aber ein vollständiges Post-Training-Rerun schlägt DeepSeeks eigenes größeres V4-Pro-Preview bei Agent-Benchmarks — bei Listenpreisen von etwa 1/36 bis 1/179 von Claude Opus 4.8. Wer eine klare Zeitachse, eine ehrliche Einschätzung der Score-Haltbarkeit und einen Vergleich mit Kimi K3 und Qwen3.8-Max braucht, findet hier: ① was tatsächlich lieferte versus was noch „coming soon" ist; ② Herstellerpreise gegenüber Artificial-Analysis-Indizes; ③ ein Sechs-Schritte-Adoptions-Runbook auf Basis der Daten vom 5. August — inklusive DSGVO-relevanter Hinweise bei Cloud-API-Nutzung.
01

Was am 31. Juli tatsächlich lieferte — und was nicht

„DeepSeek V4 offiziell" klingt nach einem neuen Modell. Ist es nicht. Der 31.-Juli-Schritt ist ein Post-Training-Refresh auf demselben Flash-Skelett. Flagship V4-Pro GA und das hauseigene Harness-Agent-Framework bleiben ohne festes Datum unveröffentlicht.

01

Kein Scale-up: DeepSeek erklärt die Gewinne ausschließlich durch Post-Training, nicht durch Parameterwachstum — ein 284B/13B Flash schlägt jetzt ein 1,6T/49B Pro-Preview bei mehreren Agent-Aufgaben.

02

Nur API-Rollout: Der offizielle Build ist ausschließlich API-Public-Beta; Consumer-App und Web-Chat wurden nicht aktualisiert.

03

Legacy-Aliase abgeschaltet: deepseek-chat und deepseek-reasoner endeten am 24. Juli — nicht migrierte Pipelines brechen hart ab.

04

Wettbewerbsdruck: Moonshots Kimi K3 (2,8T Open Weights) landete am 27. Juli, Tage vor DeepSeeks Flash-Promotion.

05

Pro-GA weiter vage: Chinesische Foren spotteten über „leere Versprechen" vor dem Flash-Überraschungsmove; V4-Pro-Offiziell-Timing bleibt unbestätigt.

DatumEreignis
24.4.2026V4-Preview: V4-Pro (1,6T/49B) + V4-Flash (284B/13B), 1M Kontext, MIT-Weights
24.7.2026Legacy-Modellnamen abgeschaltet; Traffic routet zur V4-Familie
27.7.2026Kimi K3 2,8T Weights auf Hugging Face
31.7.2026V4-Flash-0731 offizielle API-Beta + Weights; Changelog nennt Harness „coming soon"
5.8.2026V4-Pro GA weiter „so bald wie möglich"; Aug 10–20-Fenster sind unbestätigte Gerüchte
02

DeepSeek V4-Flash-Preise vs. Kimi K3 und Qwen3.8-Max

ModellStatusGesamt / AktivKontextInput miss/hit ($/1M)Output ($/1M)Lizenz
V4-Flash-0731Offiziell 31.7.284B / 13B1M$0,14 / $0,0028$0,28MIT
V4-ProPreview1,6T / 49B1M$0,435 / $0,003625$0,87MIT
Kimi K3Weights 27.7.2,8T / ~104B gesch.~1,05M$3,00 / $0,30$15,00Modified MIT
GLM-5.2Open Jun 2026~744B / ~40B1MHier nicht verifiziertNicht verifiziertMIT
Qwen3.8-MaxAPI GA 2.8.2,4T / 95B1M$2,00 / ~$0,17–0,25$6,00Weights angekündigt

Alle Angaben sind herstellerseitig veröffentlichte Listenpreise. DeepSeek kündigte einen künftigen 2×-Peak-Hour-Zuschlag (9–12 Uhr und 14–18 Uhr Peking-Zeit) ohne Wirksamkeitsdatum an. Unser V4-GA-Breakdown vom 20. Juli deckt die frühere GA-Narrative ab; dieser Artikel fokussiert den offiziellen Flash-Build vom 31. Juli.

Herstellerrechnung vs. Claude Opus 4.8: etwa 36× bei Cache-Miss-Input, 179× bei Cache-Hit-Input, 89× bei Output — Listenpreise, keine geprüften Gesamtkosten.

03

Mehr aus demselben Modell: Post-Training, CSA+HCA, Harness

V4-Flash-0731 ist in Größe und Struktur identisch mit dem April-Preview. DeepSeek führt den Agent-Benchmark-Sprung ausschließlich auf einen frischen Post-Training-Pass zurück — gegen die Standardannahme „größer gleich besser" im Modellrennen 2026.

01

Hybrid CSA+HCA Attention: Compressed Sparse Attention plus Heavily Compressed Attention, als DSA vermarktet, senkt Compute und Speicher bei langem Kontext.

02

mHC Hyper-Connections: Manifold-Constrained Hyper-Connections verfeinern Residual-Pfade für Stabilität.

03

Muon-Optimizer: Ersetzt klassische Optimizer; DeepSeek behauptet bei 1M Tokens braucht V4-Pro 27 % der V3.2 Per-Token-FLOPs und 10 % KV-Cache.

Der 31. Juli markierte auch die erste offizielle Erwähnung von DeepSeek Harness — einem hauseigenen Agent-Runner gegen Claude Code. Jeder Agent-Score, den DeepSeek für Flash-0731 veröffentlichte (Terminal Bench 2.0, Toolathlon usw.), nutzte den Harness-Minimalmodus, der noch nicht öffentlich ist. Das Changelog warnt selbst, Agent-Scores seien „extrem sensitiv gegenüber Harness-Wahl".

Hinweis: Terminal Bench 2.0 Hersteller-Score: Flash-0731 82,7 vs. V4-Pro-Preview 67,9 — max effort, top_p 0,95, temperature 1,0, Harness-Minimalmodus.

04

Chinas Open-Weight-Markt: Artificial-Analysis-Index und Sechs-Schritte-Runbook

ModellLabIntelligence IndexKosten pro Aufgabe (AA)Anmerkung
V4-Flash-0731DeepSeek50$0,03Offiziell 31.7.
Kimi K3Moonshot57$0,86Höherer Index, ~29× Kosten
GLM-5.2Zhipu~1 Pkt. über FlashNicht verifiziertOpen Jun 2026
GPT-5.6 SolOpenAI9+ Pkt. darüber$1,86Geschlossen
Claude Fable 5Anthropic9+ Pkt. darüber$3,15Geschlossen

Intelligence Index und Kosten pro Aufgabe stammen von Artificial Analysis über Finanzmedien; DeepSeeks eigene Agent-Scores nutzen andere Harnesses — die beiden Spalten nicht vermischen. DeepSeek jagt keine Leaderboard-Kronen; es optimiert für „gut genug bei einem Preis, den niemand sonst trifft" — was auch sieben Wochen OpenRouter-Spitze für das Preview erklärt.

01

Client konfigurieren: model auf deepseek-v4-flash setzen, base_url bei https://api.deepseek.com lassen; OpenAI- und Anthropic-SDK-Formate funktionieren beide.

02

Legacy-Namen bereinigen: Repos und CI nach deepseek-chat und deepseek-reasoner durchsuchen.

03

Staging-Regression: Modellnamen in Pre-Prod wechseln, Agent-Pipeline-Qualität, Latenz und Cache-Hit-Raten vergleichen.

04

Prompt-Cache maximieren: Stabile System-Prompts oben in Messages pinnen ($0,0028/M gecachter Input).

05

Nach Tier routen: Flash für Bulk und Routing; V4-Pro-Preview für schweres Reasoning bis offizielles GA.

06

Harness-GA beobachten: Changelog und Hugging Face tracken; Agent-Benchmarks nach Harness-Veröffentlichung erneut laufen lassen.

05

Benchmark-Einschränkungen, Kill Line und zitierfähige Harddaten

A

Harness-Abhängigkeit: Agent-Headline-Scores sind Hersteller plus unreleased Framework — auf Claude Code / Cursor-Reproduktionen warten.

B

Usability-Lücken: Feedback aus dem Ausland nennt niedrige Cache-Hit-Raten und gelegentliche Safety-Classifier-Timeouts — Compute-Obergrenzen zählen weiter.

C

„Kill Line" (斩杀线): Chinesischer Dev-Slang für DeepSeeks gut-genug-plus-billig-Kombo, die Rivalen zu Fähigkeit oder Preis zwingt — Kontext für GPT-5.6 Lunas 80%-Kürzung.

Nvidia, Broadcom und AMD reagierten am 31. Juli gedämpft — Märkte behandeln „DeepSeek-Effizienz" inzwischen als Routine-Engineering, anders als der R1-Chip-Selloff Anfang 2025. Berichte über eine ~7,4-Mrd.-$-Finanzierungsrunde und IPO-Vorbereitung stammen aus anonymen Finanzmedien, nicht aus regulatorischen Filings — nur Hintergrund.

V4-Flash lokal über antirez ds4 braucht 96 GB Unified Memory. Reine API-Nutzung umgeht lokale Hardware, aber hochfrequente Agent-Pipelines verlangen stabile 7×24-Hosts. Consumer-Macs und unterdimensionierte VPS-Instanzen swap-thrashen bei langem Kontext; kurze Trials stressen selten 1M-Token-Pfade. Für EU-Teams mit personenbezogenen Daten in Prompts gilt: Cloud-API-Verarbeitung außerhalb der EU erfordert eine saubere DSGVO-Grundlage (Auftragsverarbeitung, Datenminimierung); Self-Hosting oder dedizierte EU-Metal-Knoten reduzieren Transferrisiken. Für stabilere iOS-CI/CD und Agent-Automatisierung ist MESHLAUNCH Mac-Mini-Cloud-Miete meist die bessere Produktionswahl: dediziertes Apple Silicon, elastische Speichertiers, Tages-/Wochen-/Monatsabrechnung. Kapazität: Mietpreise; Setup: Hilfezentrum.

FAQ

Ja. V4-Pro und V4-Flash, einschließlich Flash-0731 vom 31.7., stehen als MIT-Weights auf Hugging Face für kommerzielle Nutzung bereit. Cloud-Preise auf unserer Mietpreisseite.

Herstellerlistenpreise: etwa 36× bei Cache-Miss-Input, 179× bei Cache-Hit-Input, 89× bei Output vs. Claude Opus 4.8 pro Million Tokens.

Kein bestätigtes Datum. Changelog nennt „so bald wie möglich". Fenster 10.–20. August sind unbestätigte Gerüchte.

SWE-bench Verified und ähnliche Drittanbieter-Suites zählen mehr. Terminal Bench 2.0 nutzte unreleased Harness — als harness-spezifisch behandeln, bis anderswo reproduziert.

DeepSeeks hauseigener Agent-Runner vs. Claude Code — Dateiedits, Tool-Aufrufe, mehrstufiges Engineering. Am 31.7. benannt; noch nicht öffentlich. Cloud-Mac-Setup im Hilfezentrum.