Test Kimi K3 2026
2,8 billions de paramètres, record open source

Architecture KDA · contexte 1M tokens · benchmarks complets · tarifs · accès API · poids ouverts le 27/07

Kimi K3 modèle open source 2,8 billions de paramètres analyse 2026
Dans la nuit du 16 juillet 2026, Moonshot AI a discrètement affiché « Kimi K3 est en ligne ! » en tête de sa documentation API — sans conférence de presse, mais avec la publication du plus grand modèle IA open source au monde par nombre de paramètres (2,8 billions). Si votre équipe évalue des agents de codage, compare Claude Fable 5 à GPT-5.6 Sol, ou attend les poids open source les plus puissants, cette analyse répond à trois questions : ce que l'architecture KDA/AttnRes/Stable LatentMoE résout concrètement ; comment K3 se positionne sur SWE Marathon, OmniDocBench et les autres benchmarks clés ; et ce que signifient en pratique les tarifs $3/$15, les quatre voies d'accès et l'ouverture complète des poids le 27 juillet.
01

Qu'est-ce que Kimi K3 ? Spécifications du modèle open source à 2,8 billions de paramètres

Le 16 juillet 2026, Moonshot AI a publié Kimi K3 — un modèle sparse Mixture-of-Experts (MoE) de 2,8 billions (2,8T) de paramètres qui dépasse le précédent record DeepSeek V4 Pro (1,6T) de près de 75 %, multiplie par 2,7 le modèle open source de Xiaomi (1,02T) et excède de plus de sept fois celui d'Alibaba (397B). Le lancement discret contraste avec l'ampleur du modèle : un billet technique, une page tarifaire et un identifiant immédiatement appelable — kimi-k3.

K3 mobilise 896 experts dont 16 activés par inférence (sparsité 1,8 %) ; couplé à un contexte ultra-long d'un million de tokens (l'équivalent d'environ cinq romans complets en une passe) et à une compréhension visuelle native, il vise le codage complexe, le raisonnement sur documents longs et le travail de connaissance. En résumé : une IA de codage open source, multimodale par nature, à mémoire ultra-longue, tarifée 40 % en dessous de Claude Opus 4.8, avec ouverture complète des poids le 27 juillet.

01

Choc d'échelle : après la montée de DeepSeek qui a érodé la part de marché de Moonshot, K3 constitue une contre-offensive stratégique — la famille Kimi a détenu le plafond de taille open source neuf mois sur les douze derniers.

02

Calendrier de lancement : annoncé la veille de la World AI Conference 2026 (WAIC), du 17 au 20 juillet, avec d'autres annonces attendues.

03

Accélération commerciale : ARR supérieure à 300 millions de dollars en juin 2026 ; sixième tour de financement cette année à une valorisation pré-money de 31,5 milliards ; revenus API au-delà de 70 % du total, utilisateurs payants à l'étranger en hausse de 400 %.

04

Problème du long contexte : l'attention complète à 1M tokens fait exploser la mémoire du cache KV — le mécanisme KDA de K3 existe précisément pour y remédier.

05

Demande d'agents de codage : des tâches longues comme SWE Marathon exigent une cohérence sur des sessions de plusieurs heures — la fenêtre 1M et un taux de cache supérieur à 90 % en sont le cœur commercial.

ParamètreValeur
Paramètres totaux2,8 billions (plus grand modèle open source au monde)
ArchitectureKDA + AttnRes + Stable LatentMoE
Experts actifs16 / 896 (MoE sparse, 1,8 %)
Fenêtre de contexte1 048 576 tokens (1M)
Modalités d'entréeTexte, image, vidéo
Mode de raisonnementEffort max permanent (low/high à venir)
Poids open source27 juillet 2026 sur Hugging Face
02

Architecture et benchmarks de Kimi K3 : KDA, AttnRes et Stable LatentMoE

Kimi Delta Attention (KDA) est un mécanisme d'attention linéaire hybride : il alterne couches d'attention linéaire et complète selon un ratio 3:1 — trois couches linéaires traitent la structure locale (calcul peu coûteux), une couche complète préserve le flux d'information globale. Résultat : mémoire du cache KV réduite jusqu'à 75 %, vitesse de décodage à 1M tokens améliorée jusqu'à 6,3×, performances supérieures aux baselines en attention complète sur contextes courts et longs et en montée en charge RL.

Attention Residuals (AttnRes) repensent les connexions résiduelles en profondeur : les résidus standard diluent les représentations critiques des premières couches ; AttnRes ajoute une récupération sélective permettant de tirer des représentations à forte valeur depuis les couches antérieures à travers la profondeur, pour un gain d'efficacité d'entraînement d'environ 25 % avec moins de 2 % de calcul supplémentaire.

Stable LatentMoE stabilise l'entraînement à sparsité extrême (896 experts / 16 actifs). Techniques associées :

TechniqueRôle
Quantile BalancingDérive l'allocation d'experts directement des quantiles de score du routeur, sans hyperparamètres heuristiques
Per-Head MuonOptimisation indépendante par tête d'attention pour un entraînement à grande échelle plus adaptatif
Sigmoid Tanh Unit (SiTU)Contrôle amélioré de la fonction d'activation
Gated MLASélectivité d'attention renforcée

Combinées, ces innovations portent l'efficacité de montée en charge de K3 d'environ 2,5× par rapport à Kimi K2. Données de benchmarks auto-déclarées par Moonshot ci-dessous (chaque modèle utilise son propre harness de raisonnement ; la réplication tierce indépendante est en cours) :

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GLM-5.2
DeepSWE67,570,073,059,046,2
Program Bench77,876,877,671,963,7
Terminal Bench 2.188,384,688,884,682,7
FrontierSWE81,286,671,366,767,3
SWE Marathon42,035,039,040,013,0
BrowseComp91,288,090,484,3
Automation Bench30,829,129,727,212,9
GPQA-Diamond93,592,694,191,091,2
MMMU-Pro (vision)81,681,283,078,9
OmniDocBench91,189,885,887,9

SWE Marathon mesure le codage soutenu sur longue durée — K3 mène à 42,0 avec une marge nette. Sur l'Artificial Analysis Intelligence Index v4.1, K3 obtient 57,1 (quatrième place), à seulement 2,8 points de Claude Fable 5 (59,9) et GPT-5.6 Sol (58,9).

03

Tarifs Kimi K3 : combien coûte-t-il face à Claude, GPT et DeepSeek ?

Le tarif standard de K3 aligne celui de Claude Sonnet 5 (3 $ / 15 $ par million de tokens) tout en offrant une fenêtre de contexte cinq fois plus large (1M vs 200K). L'entrée avec cache actif descend à 0,30 $/M (un dixième du tarif standard) ; Moonshot rapporte plus de 90 % de hits de cache dans les workflows de codage, rendant le coût d'entrée effectif très bas. La moyenne pondérée sur sept jours d'OpenRouter confirme un coût d'entrée effectif autour de 0,55 $/M.

ModèleEntrée ($/M)Sortie ($/M)Entrée cacheContexte
Kimi K33,00 $15,00 $0,30 $1M
Claude Sonnet 53,00 $ (promo 2 $)15,00 $ (promo 10 $)200K
Claude Opus 4.85,00 $25,00 $200K
GPT-5.55,00 $30,00 $400K
DeepSeek V4 Pro1,74 $3,48 $0,145 $128K
Kimi K2.60,95 $4,00 $0,16 $256K

Face à Claude Opus 4.8, K3 le devance sur plusieurs benchmarks tout en coûtant 60 % en entrée et 40 % en sortie. Tarifs API Chine : entrée ¥20/M, sortie ¥100/M, cache ¥2/M. Offre grand public : compte gratuit sur Kimi.com ; forfaits prépayés dès ¥199 (promotion jusqu'au 11 août).

04

Comment utiliser Kimi K3 dès maintenant : quatre voies d'accès et runbook en six étapes

01

Web/app Kimi (le plus simple) : rendez-vous sur kimi.com, créez un compte (connexion Google prise en charge). K3 s'exécute en effort de raisonnement maximal par défaut — sans carte bancaire.

02

Obtenir une clé API : inscrivez-vous sur platform.kimi.ai, créez une clé API et créditez le compte.

03

Configurer un client compatible OpenAI : définissez base_url="https://api.moonshot.ai/v1", identifiant de modèle kimi-k3.

04

OpenRouter : identifiant moonshotai/kimi-k3, tarification officielle Moonshot sans majoration, contexte 1M complet.

05

Activer le prompt caching : configurez des clés de cache de routage de conversation dans vos workflows de codage pour exploiter plus de 90 % de hits et ramener le coût d'entrée effectif à environ 0,55 $/M.

06

Noter le 27 juillet : publication des poids complets sur Hugging Face ; versions quantifiées MXFP4/NVFP4 et support Day-0 vLLM/SGLang attendus. Le déploiement production exige un super-nœud de 64 accélérateurs ou plus.

Python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analyse ce code pour moi..."}]
)

Calendrier open source : la WAIC du 17 au 20 juillet pourrait apporter d'autres annonces, puis le 27 juillet ouverture complète des poids K3 — premiers poids open source téléchargeables au-delà de 2 billions de paramètres.

05

Quel modèle choisir ? Matrice de cas d'usage et données citables

ScénarioModèle recommandéPourquoi
Tâches de codage longues et soutenuesKimi K3Premier sur SWE Marathon, contexte 1M le plus long
Corrections de bugs au niveau dépôtClaude Fable 5FrontierSWE 86,6 avec large avance
Agents lourds en terminal/outillageGPT-5.6 SolTerminal Bench 2.1 et Coding Agent Index en tête
Documents ultra-longs / multimodalKimi K3OmniDocBench 91,1 en tête, vision native + contexte 1M
Charges sensibles au coûtDeepSeek V4 ProSortie à 3,48 $/M seulement, bien en dessous de K3
Auto-hébergement open source (après 27/07)Kimi K3Poids open source les plus puissants, quantification MXFP4 favorable
A

Échelle paramétrique : 2,8T — près de 75 % au-dessus de DeepSeek V4 Pro (1,6T), plus grand modèle open source téléchargeable (après le 27/07).

B

Efficacité KDA : cache KV -75 %, décodage 1M tokens +6,3×, efficacité de montée en charge +2,5× (vs K2).

C

Intelligence Index : score Artificial Analysis v4.1 de 57,1 — le plus élevé parmi les modèles open source, à 2,8 points des flagships propriétaires.

Mise en garde : les benchmarks ci-dessus sont auto-déclarés par Moonshot. K3 utilise Kimi Code, GPT Codex, Claude Claude Code — chacun avec son propre harness. La réplication tierce indépendante est en cours ; interprétez-les comme orientation, non comme verdict définitif.

Kimi K3 n'est pas un exercice de vanité paramétrique — KDA, AttnRes et Stable LatentMoE sont de véritables innovations d'ingénierie qui rivalisent, voire dépassent certains flagships propriétaires sur le codage long et la compréhension documentaire. L'API seule suffit pour démarrer rapidement, mais un Mac local peine souvent sous la pression mémoire des boucles Kimi Code Agent prolongées, tandis qu'une VM sacrifie la fidélité Metal/Xcode indispensable aux workflows Apple. Pour une disponibilité 7×24 d'agents de codage, des serveurs de dev parallèles et une inférence toujours active, la location Mac Mini cloud bare-metal MESHLAUNCH constitue généralement la meilleure option de production : Apple Silicon dédié, facturation flexible au jour/semaine/mois, idéal pour le CI/CD iOS et l'automatisation d'agents IA. Consultez les tarifs de location et le centre d'aide.

Sources : blog officiel Moonshot AI · documentation Kimi API Platform · Artificial Analysis · tarifs OpenRouter · VentureBeat · SCMP

Questions fréquentes

Oui. Créez un compte gratuit sur kimi.com pour utiliser K3 en effort de raisonnement maximal. Les appels API sont payants (3 $ / 15 $ par million de tokens). Pour le budget infrastructure, consultez la page tarifs.

Les poids complets seront publiés sur Hugging Face le 27 juillet 2026. Un déploiement production exige un super-nœud de 64 accélérateurs ou plus ; le déploiement local grand public n'est pas réaliste. Modèle entraîné avec poids MXFP4 et activations MXFP8 — favorable à la quantification.

K3 affiche près du double de paramètres, un contexte huit fois plus large et de meilleurs benchmarks en codage et documents. DeepSeek V4 Pro facture seulement 3,48 $/M en sortie — plus adapté aux charges sensibles au coût. Voir le centre d'aide pour les options de déploiement associées.

Très utile pour analyser un dépôt entier en une passe, traiter de longs documents juridiques ou de recherche, et alimenter la mémoire longue d'agents multi-tours. Tarification flat sans surcoût de longueur, combinée à plus de 90 % de hits de cache, maintient les coûts réels sous contrôle.

Moonshot AI indique que les modes low et high effort arriveront dans une mise à jour ultérieure. Seul le mode max est disponible aujourd'hui.