Qwen3.8-Max Zeitachse: Von der Preview zum GA in zwei Wochen
Mitte Juli 2026 lieferten Kimi K3, Qwen3.8-Max Preview und DeepSeek V4-Flash direkt aufeinander — wer die Reihenfolge kennt, kann unterscheiden, was bereits Drittprüfer bestätigt haben und was noch Herstellerangabe ist.
16. Juli: Moonshot veröffentlicht Kimi K3 — 2,8T Parameter, 896 Experten mit 16 aktiv pro Token, Fokus auf unabhängige Reviews und Technikbericht.
19. Juli: Qwen3.8-Max Preview geht live in Token Plan / Qoder / QoderWork, Preis 10 % des GA-Tarifs; keine aktivierten Parameter veröffentlicht, keine Benchmark-Tabelle, Nutzungsbedingungen untersagen automatisierte Produktionsaufrufe.
27. Juli: Kimi K3-Gewichte wie versprochen auf Hugging Face; Attention-Kernel, MoE-Kommunikationsbibliothek und weitere Infra open-sourct.
31. Juli: DeepSeek V4-Flash GA — Parameterzahl unverändert, Architektur- und Training-Optimierungen übertreffen V4-Pro Preview bei Agent- und Code-Benchmarks.
3. August: Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle; Agent «Qianwen Office» startet parallel. Alibaba-Aktien HK +7 %, US +4,5 % am selben Tag.
Voraussichtlich um den 10. August 2026 sollen Qwen3.8-Max und die abgespeckte Qwen3.8-27B auf Hugging Face und ModelScope erscheinen — bis Redaktionsschluss fehlen konkrete Datum und Lizenztext.
Kernparameter: Qwen3.8-Max vs. Kimi K3, DeepSeek und Claude
Die Tabellen zeigen Alibaba-GA-Daten; mit «Alibaba-eigen» gekennzeichnete Werte haben noch keine Reproduktion durch Artificial Analysis oder Arena.ai.
| Merkmal | Qwen3.8-Max | Anmerkung |
|---|---|---|
| Gesamt / aktiv | 2,4T / 950 Mrd. | Sparse MoE + Hybrid-Attention |
| Kontextfenster | 1.000.000 Token | Thinking-Modus ~983k, Output-Limit ~131k |
| API-Preis (pro 1M Token) | Input $2 / Output $6 | Inland: 12 ¥ / 36 ¥ |
| Arena Text (1.8. Snapshot) | Platz 5, 1496 Punkte | Preliminary; einziges Nicht-Anthropic in Top 8 |
| SWE-bench Pro (Alibaba-eigen) | 67,7 | Hinter Fable 5 mit 80,0 |
| Gewichtsstatus | Versprochen «nächste Woche» | Bis Redaktionsschluss nicht veröffentlicht |
| Modell | Gesamt / aktiv | Preis (Input/Output) | Open Weights | Dritt-Review |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 950 Mrd. | $2 / $6 | Noch nicht (versprochen) | Keine |
| Kimi K3 | 2,8T / ~500 Mrd. | $3 / $15 | Offen (27.7.) | AA Index ≈ 57,11 |
| DeepSeek V4-Flash | Wie V4-Pro | Keine vollständige Tabelle | Offen | 9 Agent/Code-Benchmarks > V4-Pro |
| Claude Fable 5 | Nicht veröffentlicht | $10 / $50 | Geschlossen | Arena Text Platz 1 |
In einem vergleichbaren unabhängigen Blindtest (269 Dateien, reale Projektarchitektur) erreichte Kimi K3 83 Punkte, Qwen3.8-Max Preview 80 — minimaler Abstand, kein «klarer Sieger».
MoE-Effizienz, Reasoning-Stufen und Agent-Ökosystem
Qwen3.8-Max folgt der Qwen3.5 Sparse-MoE-Linie: 2,4T gesamt, 950 Mrd. aktiv — Inferenzkosten näher an Hundert-Milliarden-Modellen als an vollem 2,4T. Das erklärt API-Preise deutlich unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50).
reasoning_effort in drei Stufen — low / medium / xhigh (Standard xhigh) — lässt Geschwindigkeit und Tiefe pro Aufgabe skalieren, per enable_thinking oder Anthropic-kompatiblem reasoning.effort.
Langfristige autonome Tasks sind der Marketing-Kern: Alibaba nennt 16 Tage Coding ohne menschliche Eingriffe, 500+ Schritte Chip-Design-Optimierung und RecreationBench (Black-Box-App-Rekonstruktion nur aus Interaktion und visuellem Feedback). Teile liegen auf GitHub unter qwen-code-dev-bot/oh-my-cli — kein vollständiges Dritt-Audit.
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
message = client.messages.create(
model="qwen3.8-max",
max_tokens=8192,
thinking={"type": "enabled", "budget_tokens": 4096},
messages=[{"role": "user", "content": "Entwurf einer Drei-Service-Microservice-Architektur"}]
)
Hinweis: Die API ist OpenAI- und Anthropic-kompatibel — Anbindung an Claude Code, Codex, Qoder CLI, Qwen Code und OpenClaw ohne großen Migrationsaufwand.
Qwen3.8-Max evaluieren und anbinden: Sechs-Schritte-Runbook
Pfad festlegen: API (QwenCloud / DashScope), Warten auf Open Weights (Qwen3.8-27B realistischer) oder indirekter Aufruf über OpenClaw-Gateway. Vollständiges 2,4T-Self-Hosting braucht Multi-Node-Rechenzentrum.
API-Key und Region: Alibaba Model Studio für Qwen3.8-Max aktivieren, Quota und Region prüfen. Preview untersagte automatisierte Produktionsaufrufe — GA-Bedingungen in aktueller Doku verifizieren.
reasoning_effort konfigurieren: low für einfache Klassifikation, xhigh für komplexe Agent-Orchestrierung — Latenz und Tiefe abstimmen.
Cache-Strategie: Impliziter Cache-Hit $0,25/M, explizites Cache-Lesen $0,17/M — bei langen Agent-Workflows Cache-Trefferquote gegen Rechnung modellieren.
A/B mit eigenen Daten: Vor Produktionsmigration Blindtest gegen Kimi K3 und DeepSeek V4-Flash auf eigenem Datensatz — nicht nur Hersteller-Benchmarks.
Open-Weight-Release verfolgen: Um den 10. August Hugging Face / ModelScope, Lizenz und Qwen3.8-27B prüfen, dann Self-Hosting-Entscheidung treffen.
Open-Source-Label, Benchmark-Kontroverse und China-KI-Wettbewerb 2026
«Open-Source» vor den Gewichten: qwen.ai trägt am GA-Tag bereits Open-Source-Label, Hugging Face und ModelScope zeigen noch kein Repo — nur «nächste Woche» ohne Lizenztext.
Benchmarks aus eigenem Framework: PaperBench 93,0, OSWorld-Verified 86,1 usw. ohne neutrale Reproduktion; Arena 1496 als Preliminary markiert.
Apple Intelligence China: Qwen-Modell auf unter 4 GB komprimiert, lokal auf iPhone 15+ — kommerzielle Reichweite über Hunderte Millionen Geräte auf Systemebene.
Achtung: 2026 verschiebt sich die Erzählung von «Parameter-Wettrennen» zu «Architektur-Effizienz» — DeepSeek V4-Flash übertrifft V4-Pro ohne mehr Parameter. Qwen3.8-Max folgt dem Muster «groß gesamt, wenig aktiv», aber «erste Liga weltweit» braucht Open Weights und Dritt-Benchmarks. Bei DSGVO-relevanten Daten: Alibaba-Cloud-Verarbeitung außerhalb der EU und fehlende EU-Region vor Go-Live prüfen.
Wer OpenClaw Gateway, Claude Code oder Qwen Code lokal auf dem Mac orchestriert, kann 2,4T-Privatinferenz nicht sinnvoll betreiben; Ruhezustand und RAM-Limits unterbrechen 16-Tage-Agent-Loops. Für 7×24 iOS-CI/CD und Agent-Automatisierung ist MESHLAUNCH Mac Mini Cloud Bare-Metal die stabilere Basis: dediziertes Apple Silicon, flexible Tages-/Wochen-/Monats-Tarife — Inferenz per API, Orchestrierung und Builds auf stabilen Cloud-Mac-Knoten. Mietpreise und Hilfezentrum.
API über QwenCloud, OpenAI- und Anthropic-kompatibel. Gewichte noch nicht offen — voraussichtlich um 10. August auf Hugging Face und ModelScope. Cloud-Entwicklungsumgebung: Mietpreise.
Keine autoritative Gesamtbewertung. Blindtest: Kimi K3 83, Qwen Preview 80. K3: bereits open, Dritt-Reviews. Qwen3.8-Max: günstigere API, breiteres Multimodal.
Nur 950 Mrd. aktiv — API-Kosten wie Hundert-Milliarden-Modelle. Voll-Self-Hosting braucht Rechenzentrum; Qwen3.8-27B nach Open-Weight-Release ist der pragmatische Weg.
Orientierung, kein endgültiges Urteil — eigenes Testframework, keine AA-Reproduktion der Finalversion. Eigenes A/B empfohlen. Setup-Hilfe: Hilfezentrum.
Apple Intelligence in China nutzt komprimierte Qwen-Modelle lokal auf iPhone 15+ — Qwen-Fähigkeiten auf Systemebene ohne Modellwahl.