Alibaba Qwen3.8-Max GA
2,4-T-Parameter · Arena Text Platz 5

Arena Preliminary · 950 Mrd. aktiv · Open-Weight-Versprechen · Benchmark-Kontroverse

Alibaba Qwen3.8-Max GA: 2,4-T-Parameter in Arena Top 5
Am 3. August 2026 hat Alibaba Qwen3.8-Max offiziell GA erreicht: 2,4 Billionen Gesamtparameter, 950 Milliarden aktiviert, 1 Million Token Kontext — parallel zum Agent-Produkt «Qianwen Office». In der Arena Text Arena (Stand 1. August) liegt es vorläufig auf Platz 5 und ist das einzige Nicht-Anthropic-Modell unter den Top 8. Alle Benchmarks stammen jedoch aus Alibaba-eigenen Tests; Gewichte werden «nächste Woche» versprochen. Dieser Leitfaden richtet sich an Teams, die chinesische Frontier-APIs evaluieren: Zwei-Wochen-Zeitachse, Vergleich mit Kimi K3 und DeepSeek V4-Flash, Open-Source-Label-Kontroverse und ein Sechs-Schritte-Anbindungs-Runbook — inklusive DSGVO-Hinweis bei EU-Daten über Alibaba Cloud.
01

Qwen3.8-Max Zeitachse: Von der Preview zum GA in zwei Wochen

Mitte Juli 2026 lieferten Kimi K3, Qwen3.8-Max Preview und DeepSeek V4-Flash direkt aufeinander — wer die Reihenfolge kennt, kann unterscheiden, was bereits Drittprüfer bestätigt haben und was noch Herstellerangabe ist.

01

16. Juli: Moonshot veröffentlicht Kimi K3 — 2,8T Parameter, 896 Experten mit 16 aktiv pro Token, Fokus auf unabhängige Reviews und Technikbericht.

02

19. Juli: Qwen3.8-Max Preview geht live in Token Plan / Qoder / QoderWork, Preis 10 % des GA-Tarifs; keine aktivierten Parameter veröffentlicht, keine Benchmark-Tabelle, Nutzungsbedingungen untersagen automatisierte Produktionsaufrufe.

03

27. Juli: Kimi K3-Gewichte wie versprochen auf Hugging Face; Attention-Kernel, MoE-Kommunikationsbibliothek und weitere Infra open-sourct.

04

31. Juli: DeepSeek V4-Flash GA — Parameterzahl unverändert, Architektur- und Training-Optimierungen übertreffen V4-Pro Preview bei Agent- und Code-Benchmarks.

05

3. August: Qwen3.8-Max GA mit vollständiger Benchmark-Tabelle; Agent «Qianwen Office» startet parallel. Alibaba-Aktien HK +7 %, US +4,5 % am selben Tag.

Voraussichtlich um den 10. August 2026 sollen Qwen3.8-Max und die abgespeckte Qwen3.8-27B auf Hugging Face und ModelScope erscheinen — bis Redaktionsschluss fehlen konkrete Datum und Lizenztext.

02

Kernparameter: Qwen3.8-Max vs. Kimi K3, DeepSeek und Claude

Die Tabellen zeigen Alibaba-GA-Daten; mit «Alibaba-eigen» gekennzeichnete Werte haben noch keine Reproduktion durch Artificial Analysis oder Arena.ai.

MerkmalQwen3.8-MaxAnmerkung
Gesamt / aktiv2,4T / 950 Mrd.Sparse MoE + Hybrid-Attention
Kontextfenster1.000.000 TokenThinking-Modus ~983k, Output-Limit ~131k
API-Preis (pro 1M Token)Input $2 / Output $6Inland: 12 ¥ / 36 ¥
Arena Text (1.8. Snapshot)Platz 5, 1496 PunktePreliminary; einziges Nicht-Anthropic in Top 8
SWE-bench Pro (Alibaba-eigen)67,7Hinter Fable 5 mit 80,0
GewichtsstatusVersprochen «nächste Woche»Bis Redaktionsschluss nicht veröffentlicht
ModellGesamt / aktivPreis (Input/Output)Open WeightsDritt-Review
Qwen3.8-Max2,4T / 950 Mrd.$2 / $6Noch nicht (versprochen)Keine
Kimi K32,8T / ~500 Mrd.$3 / $15Offen (27.7.)AA Index ≈ 57,11
DeepSeek V4-FlashWie V4-ProKeine vollständige TabelleOffen9 Agent/Code-Benchmarks > V4-Pro
Claude Fable 5Nicht veröffentlicht$10 / $50GeschlossenArena Text Platz 1

In einem vergleichbaren unabhängigen Blindtest (269 Dateien, reale Projektarchitektur) erreichte Kimi K3 83 Punkte, Qwen3.8-Max Preview 80 — minimaler Abstand, kein «klarer Sieger».

03

MoE-Effizienz, Reasoning-Stufen und Agent-Ökosystem

Qwen3.8-Max folgt der Qwen3.5 Sparse-MoE-Linie: 2,4T gesamt, 950 Mrd. aktiv — Inferenzkosten näher an Hundert-Milliarden-Modellen als an vollem 2,4T. Das erklärt API-Preise deutlich unter Claude Opus 5 ($5/$25) und Fable 5 ($10/$50).

reasoning_effort in drei Stufen — low / medium / xhigh (Standard xhigh) — lässt Geschwindigkeit und Tiefe pro Aufgabe skalieren, per enable_thinking oder Anthropic-kompatiblem reasoning.effort.

Langfristige autonome Tasks sind der Marketing-Kern: Alibaba nennt 16 Tage Coding ohne menschliche Eingriffe, 500+ Schritte Chip-Design-Optimierung und RecreationBench (Black-Box-App-Rekonstruktion nur aus Interaktion und visuellem Feedback). Teile liegen auf GitHub unter qwen-code-dev-bot/oh-my-cli — kein vollständiges Dritt-Audit.

Python · Anthropic-kompatibel
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

message = client.messages.create(
    model="qwen3.8-max",
    max_tokens=8192,
    thinking={"type": "enabled", "budget_tokens": 4096},
    messages=[{"role": "user", "content": "Entwurf einer Drei-Service-Microservice-Architektur"}]
)

Hinweis: Die API ist OpenAI- und Anthropic-kompatibel — Anbindung an Claude Code, Codex, Qoder CLI, Qwen Code und OpenClaw ohne großen Migrationsaufwand.

04

Qwen3.8-Max evaluieren und anbinden: Sechs-Schritte-Runbook

01

Pfad festlegen: API (QwenCloud / DashScope), Warten auf Open Weights (Qwen3.8-27B realistischer) oder indirekter Aufruf über OpenClaw-Gateway. Vollständiges 2,4T-Self-Hosting braucht Multi-Node-Rechenzentrum.

02

API-Key und Region: Alibaba Model Studio für Qwen3.8-Max aktivieren, Quota und Region prüfen. Preview untersagte automatisierte Produktionsaufrufe — GA-Bedingungen in aktueller Doku verifizieren.

03

reasoning_effort konfigurieren: low für einfache Klassifikation, xhigh für komplexe Agent-Orchestrierung — Latenz und Tiefe abstimmen.

04

Cache-Strategie: Impliziter Cache-Hit $0,25/M, explizites Cache-Lesen $0,17/M — bei langen Agent-Workflows Cache-Trefferquote gegen Rechnung modellieren.

05

A/B mit eigenen Daten: Vor Produktionsmigration Blindtest gegen Kimi K3 und DeepSeek V4-Flash auf eigenem Datensatz — nicht nur Hersteller-Benchmarks.

06

Open-Weight-Release verfolgen: Um den 10. August Hugging Face / ModelScope, Lizenz und Qwen3.8-27B prüfen, dann Self-Hosting-Entscheidung treffen.

05

Open-Source-Label, Benchmark-Kontroverse und China-KI-Wettbewerb 2026

A

«Open-Source» vor den Gewichten: qwen.ai trägt am GA-Tag bereits Open-Source-Label, Hugging Face und ModelScope zeigen noch kein Repo — nur «nächste Woche» ohne Lizenztext.

B

Benchmarks aus eigenem Framework: PaperBench 93,0, OSWorld-Verified 86,1 usw. ohne neutrale Reproduktion; Arena 1496 als Preliminary markiert.

C

Apple Intelligence China: Qwen-Modell auf unter 4 GB komprimiert, lokal auf iPhone 15+ — kommerzielle Reichweite über Hunderte Millionen Geräte auf Systemebene.

Achtung: 2026 verschiebt sich die Erzählung von «Parameter-Wettrennen» zu «Architektur-Effizienz» — DeepSeek V4-Flash übertrifft V4-Pro ohne mehr Parameter. Qwen3.8-Max folgt dem Muster «groß gesamt, wenig aktiv», aber «erste Liga weltweit» braucht Open Weights und Dritt-Benchmarks. Bei DSGVO-relevanten Daten: Alibaba-Cloud-Verarbeitung außerhalb der EU und fehlende EU-Region vor Go-Live prüfen.

Wer OpenClaw Gateway, Claude Code oder Qwen Code lokal auf dem Mac orchestriert, kann 2,4T-Privatinferenz nicht sinnvoll betreiben; Ruhezustand und RAM-Limits unterbrechen 16-Tage-Agent-Loops. Für 7×24 iOS-CI/CD und Agent-Automatisierung ist MESHLAUNCH Mac Mini Cloud Bare-Metal die stabilere Basis: dediziertes Apple Silicon, flexible Tages-/Wochen-/Monats-Tarife — Inferenz per API, Orchestrierung und Builds auf stabilen Cloud-Mac-Knoten. Mietpreise und Hilfezentrum.

FAQ

API über QwenCloud, OpenAI- und Anthropic-kompatibel. Gewichte noch nicht offen — voraussichtlich um 10. August auf Hugging Face und ModelScope. Cloud-Entwicklungsumgebung: Mietpreise.

Keine autoritative Gesamtbewertung. Blindtest: Kimi K3 83, Qwen Preview 80. K3: bereits open, Dritt-Reviews. Qwen3.8-Max: günstigere API, breiteres Multimodal.

Nur 950 Mrd. aktiv — API-Kosten wie Hundert-Milliarden-Modelle. Voll-Self-Hosting braucht Rechenzentrum; Qwen3.8-27B nach Open-Weight-Release ist der pragmatische Weg.

Orientierung, kein endgültiges Urteil — eigenes Testframework, keine AA-Reproduktion der Finalversion. Eigenes A/B empfohlen. Setup-Hilfe: Hilfezentrum.

Apple Intelligence in China nutzt komprimierte Qwen-Modelle lokal auf iPhone 15+ — Qwen-Fähigkeiten auf Systemebene ohne Modellwahl.