De la preview au GA en quinze jours : chronologie Qwen3.8-Max
Mi-juillet 2026, Kimi K3, la preview Qwen3.8-Max et DeepSeek V4-Flash se succèdent en une semaine — la chronologie aide à distinguer ce qui est déjà vérifié par des tiers de ce qui reste communication fabricant.
16 juillet : Moonshot publie Kimi K3 — 2,8T paramètres, 896 experts dont 16 activés par token, stratégie reviews indépendantes et rapport technique.
19 juillet : Preview Qwen3.8-Max via Token Plan / Qoder / QoderWork, tarif 10 % du GA ; pas de paramètres activés publiés, pas de tableau de scores, interdiction d appels automatisés en production.
27 juillet : Poids Kimi K3 sur Hugging Face comme promis ; noyaux d attention, bibliothèque MoE et infra associée open sourcés.
31 juillet : DeepSeek V4-Flash GA — taille inchangée, gains architecture et entraînement surpassant la preview V4-Pro sur benchmarks agent et code.
3 août : Qwen3.8-Max GA avec tableau complet de benchmarks ; agent Qianwen Office en ligne. Actions Alibaba +7 % HK, +4,5 % US le jour même.
Vers le 10 août 2026, Qwen3.8-Max et la version allégée Qwen3.8-27B devraient arriver sur Hugging Face et ModelScope — date précise et licence non publiées à la rédaction.
Paramètres clés : Qwen3.8-Max face à Kimi K3, DeepSeek et Claude
Les tableaux reflètent les données GA Alibaba ; les lignes « test Alibaba » n ont pas encore été reproduites par Artificial Analysis ou Arena.ai.
| Élément | Qwen3.8-Max | Note |
|---|---|---|
| Total / activé | 2,4T / 950 Mrd | MoE sparse + attention hybride |
| Contexte | 1 000 000 tokens | Mode thinking ~983k, sortie max ~131k |
| API (par 1M tokens) | Input 2 $ / Output 6 $ | Chine : 12 ¥ / 36 ¥ |
| Arena Text (1 août) | 5e, 1496 pts | Preliminary ; seul non-Anthropic top 8 |
| SWE-bench Pro (Alibaba) | 67,7 | Derrière Fable 5 (80,0) |
| Statut poids | Promis « semaine prochaine » | Non publiés à la rédaction |
| Modèle | Total / activé | Prix (input/output) | Open weight | Review tiers |
|---|---|---|---|---|
| Qwen3.8-Max | 2,4T / 950 Mrd | 2 $ / 6 $ | Pas encore (promis) | Aucune |
| Kimi K3 | 2,8T / ~500 Mrd | 3 $ / 15 $ | Ouvert (27.7.) | AA Index ≈ 57,11 |
| DeepSeek V4-Flash | Identique V4-Pro | Table incomplète | Ouvert | 9 benchmarks agent/code > V4-Pro |
| Claude Fable 5 | Non publié | 10 $ / 50 $ | Fermé | Arena Text 1er |
Dans un blind test indépendant comparable (269 fichiers, architecture projet réelle), Kimi K3 83 points, preview Qwen3.8-Max 80 — écart minime, victoires alternées.
Efficacité MoE, paliers reasoning et stack Agent
Qwen3.8-Max prolonge la ligne MoE sparse Qwen3.5 : 2,4T au total, 950 Mrd activés — coût d inférence proche des modèles cent milliards, pas du full 2,4T. Base du tarif API bien sous Claude Opus 5 (5 $/25 $) et Fable 5 (10 $/50 $).
reasoning_effort en trois niveaux — low / medium / xhigh (défaut xhigh) — via enable_thinking ou champ reasoning.effort de l interface Anthropic compatible.
Argument commercial : tâches autonomes longues — Alibaba cite 16 jours de code sans intervention, 500+ étapes d optimisation puce, et RecreationBench (reconstruction d app en boîte noire). Traces partielles sur GitHub qwen-code-dev-bot/oh-my-cli, sans audit tiers complet.
from anthropic import Anthropic
client = Anthropic(
api_key="YOUR_DASHSCOPE_API_KEY",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)
message = client.messages.create(
model="qwen3.8-max",
max_tokens=8192,
thinking={"type": "enabled", "budget_tokens": 4096},
messages=[{"role": "user", "content": "Concevoir une architecture microservices à trois services"}]
)
À noter : API compatible OpenAI et Anthropic — branchement sur Claude Code, Codex, Qoder CLI, Qwen Code, OpenClaw sans refonte majeure.
Évaluer et intégrer Qwen3.8-Max : runbook en six étapes
Choisir le chemin : API (QwenCloud / DashScope), attendre les open weights (Qwen3.8-27B plus réaliste), ou appel indirect via passerelle OpenClaw. Self-hosting 2,4T exige datacenter multi-nœuds.
Clé API et région : activer Qwen3.8-Max sur Alibaba Model Studio, vérifier quota et région. La preview interdisait les appels production automatisés — confirmer les conditions GA.
Configurer reasoning_effort : low pour classification simple, xhigh pour orchestration Agent complexe — équilibrer latence et profondeur.
Stratégie cache : hit cache implicite 0,25 $/M, lecture cache explicite 0,17 $/M — modéliser le taux de hit pour workflows Agent long contexte.
A/B sur vos données : avant migration production, blind test contre Kimi K3 et DeepSeek V4-Flash sur votre corpus — pas seulement les scores fabricant.
Suivre l open weight : vers le 10 août, vérifier Hugging Face / ModelScope, licence et Qwen3.8-27B, puis décider self-hosting.
Label open source, controverse benchmarks et course IA chinoise 2026
Label « Open-Source » avant les poids : qwen.ai affiche open source le jour GA ; Hugging Face et ModelScope sans dépôt ni licence — seule promesse « semaine prochaine ».
Benchmarks framework interne : PaperBench 93,0, OSWorld-Verified 86,1 sans reproduction neutre ; Arena 1496 marqué Preliminary.
Apple Intelligence Chine : Qwen compressé sous 4 GB, exécution locale iPhone 15+ — rayon commercial sur des centaines de millions d appareils.
Attention : en 2026 le récit passe du « nombre de paramètres » à « efficacité d architecture » — DeepSeek V4-Flash surpasse V4-Pro sans plus de paramètres. Qwen3.8-Max suit « grand total, peu activé », mais « première ligue mondiale » exige open weights et benchmarks tiers.
Orchestrer OpenClaw Gateway, Claude Code ou Qwen Code sur un Mac local ne permet pas une inférence privée 2,4T ; veille et RAM interrompent les boucles Agent de 16 jours. Pour CI/CD iOS et automatisation Agent 7×24, MESHLAUNCH Mac Mini cloud bare-metal offre Apple Silicon dédié et tarifs jour/semaine/mois flexibles — inférence via API, orchestration et builds sur nœuds Mac cloud stables. Tarifs location et centre d aide.
API via QwenCloud, compatible OpenAI et Anthropic. Poids pas encore publiés — vers le 10 août sur Hugging Face et ModelScope. Environnement cloud : tarifs location.
Pas d évaluation globale autoritaire. Blind test : K3 83, preview Qwen 80. K3 : déjà open, reviews tiers. Qwen3.8-Max : API moins chère, multimodal plus large.
950 Mrd activés seulement — coût API type cent milliards. Self-hosting complet exige datacenter ; Qwen3.8-27B après open weight est le chemin pragmatique.
Orientation oui, verdict non — framework interne, pas de reproduction AA de la version finale. A/B propre recommandé. Configuration : centre d aide.
Apple Intelligence en Chine exécute Qwen compressé localement sur iPhone 15+ — capacités Qwen au niveau système sans choix de modèle.