Warum DeepSeek die API um bis zu 1100 % teurer macht
— direkt nach Chinas Open-Weight-Offensive

Spitzenpreise · 2,4-Billionen-Gewichte · Nachtraining · Preissetzungsmacht

DeepSeek-Preisanstieg und Chinas Open-Weight-Offensive im August 2026
Kurzfassung: DeepSeek ist nicht mehr automatisch die günstigste Frontier-API. Zwischen dem 12. und 17. August 2026 hob DeepSeek ausgewählte Tarife um bis zu 1100 % an, Alibaba veröffentlichte erstmals Max-Gewichte mit 2,4 Billionen Parametern, Zhipu lieferte GLM-5.3 mit einem rund sechsfachen Coding-Sprung auf derselben 743-Milliarden-Basis. Dieser Text liefert Zeitlinie, Tarifkarte, drei Strategien und eine sechsstufige Rechnungskontrolle. Preise und Lizenztext vor einer Weiterveröffentlichung erneut gegen die Primärquelle prüfen.
01

Was zwischen dem 12. und 17. August 2026 passiert ist

Die drei Züge wirken widersprüchlich, bis man sie als ein Signal liest. Chinesische Labore konkurrieren nicht mehr nur über den Listenpreis. Sie konkurrieren um Preissetzungsmacht.

01

16. Juli · Kimi K3: Moonshot legt Kimi K3 mit 2,8 Billionen Parametern offen und zieht US-Sicherheitsaufmerksamkeit auf sich.

02

2.–3. August · Qwen-API: Alibaba kündigt Qwen3.8-Max an und schaltet die gehostete API frei.

03

10. August · Meta-Kontrast: Muse Glimmer erscheint mit 30 Milliarden Parametern unter Apache 2.0. Meta kündigt offene Gewichte für das geschlossene Flaggschiff Muse Spark 1.2 an.

04

12. August · Gewichte öffentlich: Alibaba legt Qwen3.8-2.4T-A95B auf Hugging Face und ModelScope. Am selben Tag liefert xAI Grok 4.6.

05

13.–14. August · Erhöhung plus Nachtraining: DeepSeek-V4-Pro geht in die GA und kündigt die Erhöhung zum 17. August an. Google senkt Gemini 3.7 Flash. Zhipu folgt mit GLM-5.3 auf der 743-Milliarden-Basis von GLM-5.2.

06

17. August, 00:00 Peking · Neue Tarife: Am 30. Juli senkte OpenAI GPT-5.6 Luna um 80 %. Am 6.–7. August wurde Luna das kostenlose Standardmodell mit unbegrenztem Text. Während China Preise anhebt und Flaggschiffgewichte öffnet, geht die US-Seite am Consumer-Ende ins Kostenlose.

Hinweis: Chinesische Finanzmedien lesen das als erzwungenes globales Repricing. Englischsprachige Tech-Berichte behandeln die Drops meist isoliert. Beide Rahmen gehören zusammen.

02

DeepSeek-Tarife, Qwen3.8-Max-Spezifikation, GLM-5.3-Benches

Die 1100 % gelten nur für Peak-Cache-Hit-Input von V4-Pro, die Zeile, die zuvor fast kostenlos war. Output, der die meisten Rechnungen bestimmt, stieg um 350 %. Peak ist 9–12 und 14–18 Uhr Pekingzeit. Alle Werte gelten pro 1 Million Tokens.

Position (pro 1M Tokens)AltNeu Off-PeakNeu PeakPeak-Anstieg
V4-Flash Cache-Hit Input¥0,02¥0,05¥0,10~400 %
V4-Flash Cache-Miss Input¥1,0¥1,5¥3,0200 %
V4-Flash Output¥2,0¥4,5¥9,0350 %
V4-Pro Cache-Hit Input¥0,025¥0,15¥0,30~1100 %
V4-Pro Cache-Miss Input¥3,0¥4,5¥9,0200 %
V4-Pro Output¥6,0¥13,5¥27,0350 %

Unabhängige Modellierung setzte eine realistische Schwerlast (rund 84M Tokens, meist Off-Peak, etwa die Hälfte Cache-Hits) näher an das 1,8-Fache als an das 12-Fache.

Qwen3.8-2.4T-A95B ist das erste offene Max-Modell von Alibaba. Qwen3.5, 3.6 und 3.7 Max blieben API-only.

MerkmalWert
Parameter2,4 Bio. gesamt, 95 Mrd. aktiv (MoE, 512 Experten, 10 geroutet + 1 geteilt)
Kontext262.144 Tokens nativ, erweiterbar auf ~1,01M; gehostetes Max standardmäßig 1M
TaktVorschau 2. Aug. → API 3. Aug. → Gewichte 12. Aug.
Internationale API2 $ / M Input, 6 $ / M Output
LizenzNicht Apache 2.0. Eigene Qwen3.8-Max License

GLM-5.3 nutzt dieselbe 743-Milliarden-Basis wie GLM-5.2. Die Zahlen stammen von Zhipu. Eine unabhängige Wiederholung fehlt.

BenchmarkGLM-5.2GLM-5.3Delta
Terminal-Bench 3.04,6 %28,3 %+23,7
DeepSWE v1.146,2 %66,9 %+20,7
Agents' Last Exam (CLI)23,8 %28,5 %+4,7
CyberGym77,2 %84,5 %+7,3
AutomationBench26,2 %48,2 %+22,0

Hinweis: Auf Terminal-Bench 3.0 liegt GLM-5.3 hinter GPT-5.6 Sol (34,6 %) und Claude Fable 5 (33,7 %). Es ist ein Spitzenwert unter offenen Gewichten, kein Frontier-Sieg.

03

Ist DeepSeek nach der Erhöhung noch das günstigste Flaggschiff?

Nein. Off-Peak-V4-Pro bleibt klar unter Claude Opus 5. Es ist nicht mehr das billigste Angebot. Die internationale Qwen3.8-Max-API und OpenAI Luna unterbieten DeepSeek Off-Peak mindestens auf einer Achse.

Die Erhöhung ist ein Kapazitätsproblem, keine Premium-Wende. Der alte Flattarif funktionierte, solange GPUs mitwuchsen. Steigt die Nutzung schneller als das Angebot, muss das Preisschild die Knappheit zeigen. „Flexiblere Lastplanung“ heißt: Peak-Compute ist knapp, verschieben Sie die Last selbst.

Ein Detail, das internationale Berichte oft auslassen: Zur Peak-Zeit liegt die offizielle API über mehreren Wiederverkäufern, darunter GMI Cloud und Novita. Die Annahme, der offizielle Endpunkt sei immer der günstigste Weg zu DeepSeek, ist gebrochen.

Alibaba gibt die 2,4-Billionen-Gewichte frei und hängt eine eigene Lizenz an, nicht Apache 2.0. Model-as-a-Service oder KI-Arbeitsassistenten mit mehr als 50 Millionen US-Dollar Umsatz in 12 Monaten brauchen eine separate Handelslizenz. Produkte mit über 100 Millionen monatlich Aktiven oder 20 Millionen US-Dollar Monatsumsatz müssen den Modellnamen sichtbar zeigen. Das ist ein anderes Offenheitsniveau als Metas Muse Glimmer unter uneingeschränktem Apache 2.0.

Gerüchte über ein Downloadverbot für USA, EU, Großbritannien oder Südkorea sind falsch. Der veröffentlichte Text enthält keine Territorialklausel. Für europäische Teams bleibt relevant: Wenn Sie offene Gewichte lokal hosten und dabei personenbezogene Daten verarbeiten, gelten die üblichen DSGVO-Pflichten zur Datenverarbeitung unabhängig von der Modelllizenz.

Bei GLM-5.3 zählt die Methode. Dieselbe 743-Milliarden-Basis, kein Retraining, Terminal-Bench 3.0 von 4,6 % auf 28,3 % durch skalierte RL-Umgebungen im Nachtraining. Wenn Vortraining abflacht, wird Nachtraining-RL der günstigere Hebel als ein neues Foundation-Modell.

ModellInput / 1M TokensOutput / 1M TokensOffene Gewichte
DeepSeek V4-Pro (Peak)¥9,0 (~1,26 $)¥27,0 (~3,78 $)Nein
DeepSeek V4-Pro (Off-Peak)¥4,5 (~0,63 $)¥13,5 (~1,89 $)Nein
Qwen3.8-Max (internationale API)2,00 $6,00 $Ja (eigene Lizenz)
OpenAI GPT-5.6 Luna0,20 $1,20 $Nein
Claude Opus 5 (impliziert über Alibaba-Verhältnis)~5,00 $~25,00 $Nein
cest map
Beijing peak: 09:00-12:00 and 14:00-18:00 CST
= 03:00-06:00 and 08:00-12:00 CEST (Aug 2026)
FX ref ≈ ¥7.15 / $1

„Chinesisches Modell = günstigstes Modell“ galt 2025 und Anfang 2026. Es ist keine sichere Default-Annahme mehr.

04

Sechs Schritte, um die neue DeepSeek-Rechnung und die Qwen-Lizenz zu lesen

Bauen Sie den Stack nicht nach einer Schlagzeilen-Multiplikation um. Trennen Sie zuerst Position, Uhr und Lizenzschwelle.

01

Die Tarifzeile benennen: 1100 %, 350 % und 200 % sind alle korrekt. Sie beschreiben Cache-Hit-Input, Output und Cache-Miss-Input. Rechnungen bewegen die letzten beiden.

02

Den Arbeitstag auf Peking-Peak legen: 9–12 und 14–18 Uhr Peking. Mitteleuropäische Vormittage überlappen das zweite Fenster. Batch und Eval-Schleifen explizit verschieben.

03

Aus der Trefferquote schätzen: Eine schwere Off-Peak-Mischung mit etwa der Hälfte Hits liegt modelliert bei rund 1,8fach. Peak plus niedrige Trefferquote macht 350 % und 1100 % real.

04

Qwen-Umsatzschwellen prüfen: Persönlich und intern bleibt frei. Separate Handelslizenz ab 50 Millionen US-Dollar in 12 Monaten für MaaS oder KI-Arbeitsassistent. Modellname sichtbar ab 100 Millionen MAU oder 20 Millionen US-Dollar Monatsumsatz. Kein Geoverbot. Lokales Hosting mit Personenbezug bleibt DSGVO-pflichtig.

05

GLM-5.3 als Nachtraining führen: Dieselbe 743-Milliarden-Basis. Nur Herstellerbenches. Bis zur Drittwiederholung gilt „offene erste Liga, kein geschlossener Frontier-Sieg“.

06

Offizielle API, Reseller und lokale Gewichte trennen: Offizieller Peak kann über GMI Cloud oder Novita liegen. Offene Gewichte verschieben Kosten von Tokens auf Speicher und Uptime. Für einen Host, der nicht schläft, beginnen Sie mit den MESHLAUNCH-Mietpreisen und dem Hilfezentrum.

05

Ungeprüfte Behauptungen, zwei Preiskriege, drei zitierbare Zahlen

Diese vier Punkte bleiben außerhalb der bestätigten Spalte, bis Primärquellen nachziehen:

A

Die 1100-Prozent-Schlagzeile: Technisch korrekt, ohne Tarifzeile irreführend. Nur Peak-Cache-Hit-Input.

B

Zhenwu-M890-Silizium: Mehrere chinesische Finanzmedien berichten, Teile der Qwen3.8-Max-Inferenz liefen auf Alibabas Zhenwu M890 und „Pangu AL128“-Superknoten. Alibaba hat keine unabhängigen technischen Dokumente oder Drittbenches veröffentlicht. Als ungeprüft führen.

C

Eine „schwere“ Cursor-Lücke: VentureBeat und Zhipu. Technische Details fehlen. Herstellerquelle, nicht unabhängig auditiert.

D

Vergeltungs-Exportkontrollen: Berichte über mögliche Gegenmaßnahmen des chinesischen Handelsministeriums bleiben spekulativ. Keine offizielle Ankündigung.

Inländische Finanzmedien nennen den letzten Monat „drei Modellupdates pro Woche“. DeepSeek, Alibaba und Zhipu sitzen auf Moonshots Kimi K3 (2,8 Bio., 16. Juli) und MiniMax H3. US-Labore liefen den gegenteiligen Consumer-Zug: Luna minus 80 % am 30. Juli, dann frei und unbegrenzt am 6.–7. August; Gemini 3.7 Flash am 13. August zum halben Preis des drei Wochen alten Vorgängers.

Es gibt eine geopolitische Lesart, die die englischsprachige Tech-Presse weitgehend übersprungen hat. Kimi K3 zog bereits US-Sicherheitsprüfung an. Manche Analysten lesen Alibabas 2,4-Billionen-Drop in diesem Fenster als Versuch, internationale Sichtbarkeit und eine Paritätserzählung zu sichern, bevor Regeln enger werden. Das ist Interpretation, kein bestätigter Fakt. Es gehört trotzdem zum Timing.

Drei zitierbare Zahlen: ① V4-Pro Peak-Cache-Hit-Input ¥0,025 → ¥0,30 (~1100 %); Output ¥6,0 → ¥27,0 (350 %). ② Qwen3.8-2.4T-A95B: 2,4 Bio. gesamt / 95 Mrd. aktiv; internationale API 2 $ / 6 $. ③ GLM-5.3 Terminal-Bench 3.0: 4,6 % → 28,3 % auf derselben 743-Milliarden-Basis, Herstellerangabe.

Quellen: DeepSeek-Preisankündigung, abgeglichen mit Wall Street CN, IT Home, AIGC.cn und V2EX; Alibaba-Qwen-Repositorien auf Hugging Face / ModelScope und SCMP zur Lizenz; Z.ai-Seite zu GLM-5.3 plus VentureBeat und StableLearn; Meta AI Research und VentureBeat zu Muse Glimmer; Yicai und Sohu Finance zum Veröffentlichungstakt. Stand der öffentlichen Informationen: Redaktionsschluss.

Peak-APIs bestrafen Dauer-Eval-Schleifen. Offene Gewichte bestrafen Hosts, die schlafen oder Ports teilen. Ein zugeklapptes Notebook oder ein billiger VPS ohne Metal verzerrt lokale Benches und Agenten-Soak-Tests. Für einen Produktionshost, der für iOS-CI/CD und KI-Agenten-Automatisierung oben bleibt, ist eine MESHLAUNCH-Mac-Mini-Cloudmiete meist die sauberere Option: dediziertes Apple Silicon, 7×24, Tages-/Wochen-/Monatsverträge. Siehe die Preisseite und das Hilfezentrum.

FAQ

Es kommt auf Zeitfenster und Cache-Trefferquote an. Außerhalb der Pekinger Spitzen 9–12 und 14–18 Uhr und bei hoher Trefferquote liegt die reale Rechnung laut Modellierung eher bei etwa 1,8fach, nicht bei 350 oder 1100 Prozent. Peak plus niedrige Trefferquote nähert sich der Schlagzeile.

Persönliche und interne Nutzung bleiben weitgehend frei. Ein separates Alibaba-Lizenzgeschäft gilt, wenn ein Model-as-a-Service- oder KI-Arbeitsassistenten-Umsatz in 12 Monaten 50 Millionen US-Dollar übersteigt. Ab 100 Millionen MAU oder 20 Millionen US-Dollar Monatsumsatz muss der Modellname sichtbar stehen.

Die Basis ist identisch: 743 Milliarden Parameter, kein erneutes Vortraining. Die Sprünge kommen aus skaliertem Reinforcement Learning im Nachtraining.

Nein. Der veröffentlichte Lizenztext enthält keine geografische Klausel. Die Schwellen sind umsatzbasiert, nicht standortbasiert.

Nur teilweise. Muse Glimmer ist ein destilliertes 30-Milliarden-Modell. Das geschlossene Flaggschiff Muse Spark 1.2 ist noch nicht offen. Zuckerberg hat „bald“ gesagt. Für einen stabilen Eval-Host starten Sie mit der Preisseite und dem Hilfezentrum.