Kimi K3 Open Weight : pourquoi cette publication compte
Kimi K3 est un modèle MoE (Mixture of Experts) de 2,8 billions de paramètres au total, avec environ 104 milliards de paramètres activés par inférence, une fenêtre de contexte d'un million de tokens et une compréhension visuelle native. Les poids sur Hugging Face pèsent environ 1,56 To et ont atteint la première place du classement tendances en moins d'une demi-heure. Cette ouverture n'intervient que 11 jours après le lancement initial sur kimi.com et via l'API.
16 juillet (veille du WAIC 2026) : Kimi K3 déployé sur kimi.com, Kimi Work, Kimi Code et l'API Moonshot — appel en ligne uniquement, poids non publiés. Titre du billet technique : « Kimi K3: Open Frontier Intelligence ».
17 juillet : analyses sectorielles intensives ; l'agence Xinhua le qualifie de plus grand modèle open weight au monde.
22–23 juillet : escalade de la controverse sur la distillation de modèles entre États-Unis et Chine. Michael Kratsios, conseiller technologique de la Maison Blanche, accuse Moonshot d'une distillation industrielle à grande échelle du modèle Fable d'Anthropic ; le secrétaire au Trésor Scott Bessent évoque des sanctions et une inscription sur la liste d'entités.
27 juillet vers 23 h : publication des poids complets, du rapport technique, et ouverture de MoonEP et AgentEnv (FlashKDA était déjà disponible).
28 juillet : le ministère du Commerce chinois répond publiquement à la dispute IA sino-américaine, dénonçant un « impérialisme de l'IA » américain et menaçant de contre-mesures ; les médias nationaux couvrent les détails de cette ouverture.
Trois jours plus tard, Alibaba — l'un des investisseurs de Moonshot — a publié Qwen3.8-Max-Preview, un modèle de 24 billions de paramètres, largement interprété comme une réponse directe à K3. La compétition des grands modèles chinois entre désormais dans le « club des 3T ».
Paramètres clés et benchmarks : K3 face à GPT-5.6 et Claude
Les chiffres varient selon les organismes et les frameworks d'évaluation. Nous privilégions ci-dessous les données de réplication tierces indépendantes ; les chiffres auto-déclarés par le fabricant sont signalés séparément.
| Paramètre | Kimi K3 | Remarque |
|---|---|---|
| Paramètres totaux | 2,8 billions (2,8T) | Premier modèle 3T entièrement ouvert |
| Paramètres activés | ~104 milliards | Activation sparse MoE |
| Configuration experts | 896 experts routés, 16 activés par token | Sparsité ~1,8 % |
| Fenêtre de contexte | 1 million de tokens | KDA + Gated MLA en attention hybride |
| Volume des poids | ~1,56 To | Poids MXFP4 + activations MXFP8 |
| Licence | Licence personnalisée | Terme officiel : « open weight », pas « open source » |
SWE-bench Verified (réplication indépendante, Vals AI, juillet 2026)
| Modèle | Score | Date de publication |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Kimi K3 représente le plafond de capacité du camp open weight, pas l'option la plus rentable — index Artificial Analysis #3 mondial et #1 open weight, mais coût par tâche d'environ 0,95 $, supérieur aux ~0,47 $/tâche de GLM-5.2.
KDA, AttnRes, Per-Head Muon et trois briques d'infra open source
Kimi K3 repense trois composants fondamentaux du deep learning — mécanisme d'attention, connexions résiduelles et optimiseur — ce qui le distingue d'une simple accumulation de paramètres.
Kimi Delta Attention (KDA) transforme la porte d'oubli scalaire du Gated DeltaNet en porte par canal : chaque dimension de caractéristique possède son propre taux de décroissance, avec une récurrence en temps linéaire via la formule chunkwise DPLR. K3 alterne KDA et quelques couches d'attention globale (Gated MLA), supportant 1 million de tokens tout en réduisant drastiquement le coût du KV Cache.
Attention Residuals (AttnRes) remplace la connexion résiduelle uniforme par une agrégation sélective et dynamique des sorties de toutes les couches précédentes — chaque couche n'ajoute qu'un RMSNorm et un pseudo-vecteur de requête, pour un gain d'efficacité d'entraînement d'environ 25 % à un coût inférieur à 2 %.
Per-Head Muon permet à chaque tête d'attention d'apprendre indépendamment avec une trajectoire de convergence plus adaptative. Combiné à Stable LatentMoE (routage sparse 896-sur-16 + stratégie Quantile Balancing), Moonshot a démontré mathématiquement la borne supérieure théorique du nombre d'experts redondants par nœud de calcul.
| Technologie | Rôle | Capacité clé |
|---|---|---|
| MoonEP | Bibliothèque de communication MoE à très grande échelle | Duplication temporaire des experts surchargés pour équilibrer les tokens par nœud ; borne théorique des experts redondants |
| FlashKDA | Opérateur KDA haute performance basé sur CUTLASS | Prefill 1,72–2,22× plus rapide sur H20 ; remplace directement le backend chunk_kda |
| AgentEnv | Sandbox agent microVM Firecracker | Checkpoint en 133 ms, reprise en 49 ms, surallocation mémoire jusqu'à 6,5× (données officielles, non répliquées par des tiers) |
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
À retenir : Moonshot n'a pas seulement publié des poids — trois technologies d'infrastructure essentielles à l'efficacité et à la stabilité de K3 ont également été ouvertes, ce qui explique l'accueil favorable de la communauté développeur.
Intégration et déploiement de Kimi K3 : runbook en six étapes
Choisir la voie d'accès : évaluer si l'équipe a besoin de l'API, d'un hébergement tiers via OpenRouter, ou d'un auto-déploiement sur super-nœud 64+ cartes. Pour les développeurs individuels et la plupart des PME, l'API ou OpenRouter reste la voie réaliste.
Configurer l'API Moonshot : obtenir une clé sur https://api.moonshot.ai/v1, identifiant modèle kimi-k3, compatible SDK OpenAI — la plupart des projets existants n'ont qu'à modifier l'URL de base et la clé.
Optimiser le cache : l'architecture d'inférence découplée Mooncake atteint plus de 90 % de taux de cache hit sur les charges de programmation typiques, ramenant le coût effectif vers 0,30 $/M en entrée (cache hit) plutôt que 3,00 $/M (cache miss).
Évaluer l'auto-hébergement (optionnel) : télécharger ~1,56 To de poids depuis Hugging Face moonshotai/Kimi-K3, prévoir un super-nœud 64+ cartes, configurer le parallélisme expert et tensoriel.
Auditer la licence : vérifier si votre activité déclenche le seuil MaaS de 20 millions de dollars de revenus annuels, ou le seuil d'affichage de 100 millions d'utilisateurs actifs mensuels / 20 millions de dollars de revenus mensuels.
Intégrer la chaîne d'outils infra : pour les opérateurs KDA, basculer le backend chunk_kda de la bibliothèque flash-linear-attention vers FlashKDA ; pour l'entraînement RL d'agents à grande échelle, évaluer l'intégration du sandbox AgentEnv.
Double seuil de licence et tarification API
Open weight vs open source : Moonshot n'a jamais employé le terme « open source » dans ses documents officiels, mais « open weight ». Au sens OSI, K3 ne publie que les poids, le rapport technique et des outils d'inférence — pas les données d'entraînement ni le code d'entraînement complet.
Seuil MaaS (Model-as-a-Service) : si vous exploitez un service MaaS et dépassez 20 millions de dollars de revenus cumulés sur 12 mois consécutifs, un accord commercial distinct avec Moonshot est requis.
Tarification API (par million de tokens) : entrée cache hit 0,30 $, entrée cache miss 3,00 $, sortie (incluant le raisonnement) 15,00 $. Artificial Analysis mesure environ 0,95 $/tâche, soit ~60 % de moins que Claude Fable 5 (~2,4 $/tâche).
Attention : l'échelle de 2,8 billions de paramètres et 896 experts rend K3 quasi impossible à exécuter sur du matériel grand public. OpenRouter compte déjà sept fournisseurs proposant K3, avec des tarifs généralement alignés sur l'officiel.
Si votre équipe doit orchestrer des agents, des pipelines CI/CD ou des processus Gateway en permanence sur un Mac local, l'auto-hébergement de K3 sur GPU grand public n'est pas réaliste ; la mise en veille, les mises à jour système et les limites mémoire d'un Mac personnel interrompent également les tâches agent longues. Pour un environnement de production iOS CI/CD et automatisation d'agents IA en 7×24, la location cloud Mac Mini MESHLAUNCH est généralement la meilleure option : Apple Silicon dédié, facturation flexible au jour/semaine/mois — déléguer l'inférence à l'API, conserver l'orchestration et les builds sur un nœud Mac cloud stable. Consultez la page tarifs et le centre d'aide pour configurer votre environnement.
Pas au sens OSI. Il s'agit d'un modèle « open weight » : les poids entraînés, le rapport technique et une partie de l'infrastructure sont publics, mais les données d'entraînement et le code d'entraînement complet ne le sont pas. Pour plus de contexte, voir notre article sur la publication des poids K3.
Oui, dans la grande majorité des cas. Si vous exploitez un service Model-as-a-Service avec plus de 20 millions de dollars de revenus annuels, ou un produit dépassant 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels, des conditions supplémentaires s'appliquent. Consultez la page tarifs pour les solutions d'environnement cloud.
Moonshot recommande un super-nœud d'au moins 64 accélérateurs. Pour la plupart des équipes, l'API officielle ou OpenRouter reste l'option réaliste. Le centre d'aide détaille la configuration d'un environnement Mac cloud pour l'orchestration d'agents.
Premier rang parmi les modèles open weight, index Artificial Analysis #3 mondial derrière Claude Fable 5 et GPT-5.6 Sol. Coût par tâche supérieur à GLM-5.2. K3 occupe actuellement la première place du classement Frontend Code Arena sur Arena.ai. Voir aussi notre analyse Claude Opus 5 vs Kimi K3.
K3 compte environ trois fois plus de paramètres que K2.5, avec Attention Residuals et Per-Head Muon, une fenêtre de contexte et des capacités multimodales nettement élargies. La licence K3 introduit des seuils MaaS absents de la série K2. Notre test K3 du 16 juillet couvre l'architecture en détail.