Qwen3.8-Max en GA
2,4 billions · 5e Arena Text

Preliminary Arena · 950 Mrd actifs · promesse open weight · controverse benchmarks

Qwen3.8-Max Alibaba GA : 2,4 billions de paramètres, 5e Arena Text
Le 3 août 2026, Alibaba a mis Qwen3.8-Max en disponibilité générale (GA) : 2,4 billions de paramètres totaux, 950 milliards activés, fenêtre de contexte d'un million de tokens, et lancement simultané de l agent « Qianwen Office ». Sur l Arena Text (capture 1 août), il occupe provisoirement la 5e place — seul modèle non-Anthropic dans le top 8. Tous les scores publiés restent des tests internes Alibaba ; les poids open sont annoncés « la semaine prochaine ». Cet article s adresse aux équipes qui comparent les API chinoises de frontière : chronologie sur deux semaines, tableau face à Kimi K3 et DeepSeek V4-Flash, polémique du label open source, et runbook d intégration en six étapes.
01

De la preview au GA en quinze jours : chronologie Qwen3.8-Max

Mi-juillet 2026, Kimi K3, la preview Qwen3.8-Max et DeepSeek V4-Flash se succèdent en une semaine — la chronologie aide à distinguer ce qui est déjà vérifié par des tiers de ce qui reste communication fabricant.

01

16 juillet : Moonshot publie Kimi K3 — 2,8T paramètres, 896 experts dont 16 activés par token, stratégie reviews indépendantes et rapport technique.

02

19 juillet : Preview Qwen3.8-Max via Token Plan / Qoder / QoderWork, tarif 10 % du GA ; pas de paramètres activés publiés, pas de tableau de scores, interdiction d appels automatisés en production.

03

27 juillet : Poids Kimi K3 sur Hugging Face comme promis ; noyaux d attention, bibliothèque MoE et infra associée open sourcés.

04

31 juillet : DeepSeek V4-Flash GA — taille inchangée, gains architecture et entraînement surpassant la preview V4-Pro sur benchmarks agent et code.

05

3 août : Qwen3.8-Max GA avec tableau complet de benchmarks ; agent Qianwen Office en ligne. Actions Alibaba +7 % HK, +4,5 % US le jour même.

Vers le 10 août 2026, Qwen3.8-Max et la version allégée Qwen3.8-27B devraient arriver sur Hugging Face et ModelScope — date précise et licence non publiées à la rédaction.

02

Paramètres clés : Qwen3.8-Max face à Kimi K3, DeepSeek et Claude

Les tableaux reflètent les données GA Alibaba ; les lignes « test Alibaba » n ont pas encore été reproduites par Artificial Analysis ou Arena.ai.

ÉlémentQwen3.8-MaxNote
Total / activé2,4T / 950 MrdMoE sparse + attention hybride
Contexte1 000 000 tokensMode thinking ~983k, sortie max ~131k
API (par 1M tokens)Input 2 $ / Output 6 $Chine : 12 ¥ / 36 ¥
Arena Text (1 août)5e, 1496 ptsPreliminary ; seul non-Anthropic top 8
SWE-bench Pro (Alibaba)67,7Derrière Fable 5 (80,0)
Statut poidsPromis « semaine prochaine »Non publiés à la rédaction
ModèleTotal / activéPrix (input/output)Open weightReview tiers
Qwen3.8-Max2,4T / 950 Mrd2 $ / 6 $Pas encore (promis)Aucune
Kimi K32,8T / ~500 Mrd3 $ / 15 $Ouvert (27.7.)AA Index ≈ 57,11
DeepSeek V4-FlashIdentique V4-ProTable incomplèteOuvert9 benchmarks agent/code > V4-Pro
Claude Fable 5Non publié10 $ / 50 $FerméArena Text 1er

Dans un blind test indépendant comparable (269 fichiers, architecture projet réelle), Kimi K3 83 points, preview Qwen3.8-Max 80 — écart minime, victoires alternées.

03

Efficacité MoE, paliers reasoning et stack Agent

Qwen3.8-Max prolonge la ligne MoE sparse Qwen3.5 : 2,4T au total, 950 Mrd activés — coût d inférence proche des modèles cent milliards, pas du full 2,4T. Base du tarif API bien sous Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).

reasoning_effort en trois niveaux — low / medium / xhigh (défaut xhigh) — via enable_thinking ou champ reasoning.effort de l interface Anthropic compatible.

Argument commercial : tâches autonomes longues — Alibaba cite 16 jours de code sans intervention, 500+ étapes d optimisation puce, et RecreationBench (reconstruction d app en boîte noire). Traces partielles sur GitHub qwen-code-dev-bot/oh-my-cli, sans audit tiers complet.

Python · compatible Anthropic
from anthropic import Anthropic

client = Anthropic(
    api_key="YOUR_DASHSCOPE_API_KEY",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

message = client.messages.create(
    model="qwen3.8-max",
    max_tokens=8192,
    thinking={"type": "enabled", "budget_tokens": 4096},
    messages=[{"role": "user", "content": "Concevoir une architecture microservices à trois services"}]
)

À noter : API compatible OpenAI et Anthropic — branchement sur Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw sans refonte majeure.

04

Évaluer et intégrer Qwen3.8-Max : runbook en six étapes

01

Choisir le chemin : API (QwenCloud / DashScope), attendre les open weights (Qwen3.8-27B plus réaliste), ou appel indirect via passerelle OpenClaw. Self-hosting 2,4T exige datacenter multi-nœuds.

02

Clé API et région : activer Qwen3.8-Max sur Alibaba Model Studio, vérifier quota et région. La preview interdisait les appels production automatisés — confirmer les conditions GA.

03

Configurer reasoning_effort : low pour classification simple, xhigh pour orchestration Agent complexe — équilibrer latence et profondeur.

04

Stratégie cache : hit cache implicite 0,25 $/M, lecture cache explicite 0,17 $/M — modéliser le taux de hit pour workflows Agent long contexte.

05

A/B sur vos données : avant migration production, blind test contre Kimi K3 et DeepSeek V4-Flash sur votre corpus — pas seulement les scores fabricant.

06

Suivre l open weight : vers le 10 août, vérifier Hugging Face / ModelScope, licence et Qwen3.8-27B, puis décider self-hosting.

05

Label open source, controverse benchmarks et course IA chinoise 2026

A

Label « Open-Source » avant les poids : qwen.ai affiche open source le jour GA ; Hugging Face et ModelScope sans dépôt ni licence — seule promesse « semaine prochaine ».

B

Benchmarks framework interne : PaperBench 93,0, OSWorld-Verified 86,1 sans reproduction neutre ; Arena 1496 marqué Preliminary.

C

Apple Intelligence Chine : Qwen compressé sous 4 GB, exécution locale iPhone 15+ — rayon commercial sur des centaines de millions d appareils.

Attention : en 2026 le récit passe du « nombre de paramètres » à « efficacité d architecture » — DeepSeek V4-Flash surpasse V4-Pro sans plus de paramètres. Qwen3.8-Max suit « grand total, peu activé », mais « première ligue mondiale » exige open weights et benchmarks tiers.

Orchestrer OpenClaw Gateway, Claude Code ou Qwen Code sur un Mac local ne permet pas une inférence privée 2,4T ; veille et RAM interrompent les boucles Agent de 16 jours. Pour CI/CD iOS et automatisation Agent 7×24, MESHLAUNCH Mac Mini cloud bare-metal offre Apple Silicon dédié et tarifs jour/semaine/mois flexibles — inférence via API, orchestration et builds sur nœuds Mac cloud stables. Tarifs location et centre d aide.

FAQ

API via QwenCloud, compatible OpenAI et Anthropic. Poids pas encore publiés — vers le 10 août sur Hugging Face et ModelScope. Environnement cloud : tarifs location.

Pas d évaluation globale autoritaire. Blind test : K3 83, preview Qwen 80. K3 : déjà open, reviews tiers. Qwen3.8-Max : API moins chère, multimodal plus large.

950 Mrd activés seulement — coût API type cent milliards. Self-hosting complet exige datacenter ; Qwen3.8-27B après open weight est le chemin pragmatique.

Orientation oui, verdict non — framework interne, pas de reproduction AA de la version finale. A/B propre recommandé. Configuration : centre d aide.

Apple Intelligence en Chine exécute Qwen compressé localement sur iPhone 15+ — capacités Qwen au niveau système sans choix de modèle.