Date de publication Kimi K3 : lancement API vs dépôt des poids
Le 16 juillet 2026, Moonshot a déployé Kimi K3 via Kimi App, Kimi Work, Kimi Code et l'API. Artificial Analysis a publié une évaluation indépendante le même jour. Le 27 juillet, les poids complets (Modified MIT) et un rapport technique (architecture, entraînement, évaluation) seront disponibles sur Hugging Face.
Conclusion : K3 n'est pas un tueur de Fable 5. L'index AA Intelligence 57,1 le place #3 sur 189, derrière Claude Fable 5 (59,9) et GPT-5.6 Sol (58,9). Il offre une capacité proche du frontier à environ un tiers du coût, plus deux atouts impossibles en modèle fermé : poids téléchargeables et contexte 1M tokens.
| Date | Événement |
|---|---|
| 2026-07-16 | Lancement API K3 et suite Kimi ; benchmarks Artificial Analysis |
| 2026-07-17 | Ouverture WAIC à Shanghai ; médias d'État présentent K3 comme jalon national |
| 2026-07-27 | Poids complets sur Hugging Face (Modified MIT) + rapport technique |
API disponible dès maintenant : identifiant kimi-k3 sur platform.kimi.ai — pas besoin d'attendre les poids pour développer.
Poids ≠ exécution locale immédiate : le support vLLM pour KDA et le prefix caching arrive avec la publication ; ports Ollama et GGUF suivront le modèle K2.
Position éditoriale remarquable : Moonshot reconnaît publiquement son retard face à Fable 5 et Sol — sensibilité aux harness et réponses trop proactives sur prompts ambigus.
Contexte géopolitique : calendrier aligné sur le WAIC. Régulateurs US ont brièvement retiré Fable/Mythos d'Anthropic en juin (rétablis le 1er juillet) — narrative : on peut bloquer une API fermée, pas des poids publiés.
Retour de Moonshot : après DeepSeek R1 (part de marché tombée à #7 domestiquement début 2025), la feuille de route K2 → K2.5 → K3 a restauré la crédibilité open weights.
Qu'est-ce que Kimi K3 ? Spécifications essentielles
K3 repose sur Stable LatentMoE : 896 experts, 16 activés par token (~1,8 % de sparsité). Stack d'attention : Kimi Delta Attention (KDA, attention linéaire hybride) + Attention Residuals (AttnRes) + Gated MLA. Poids en MXFP4, activations MXFP8 (entraînement basse précision native). Efficacité de scaling ~2,5× supérieure à K2 ; KDA apporte jusqu'à 6,3× d'accélération decode à 1M de contexte.
| Spécification | Valeur |
|---|---|
| Paramètres totaux | 2,8 billions — plus grand modèle open weights à ce jour |
| Architecture | MoE sparse : Stable LatentMoE, 896 experts / 16 actifs par token |
| Attention | KDA + AttnRes + Gated MLA |
| Fenêtre de contexte | 1 048 576 tokens (1M) |
| Modalités | Vision native (texte + image ; vidéo en produit), sortie texte |
| Format des poids | MXFP4 + activations MXFP8 |
| Stabilité d'entraînement | Quantile Balancing, optimiseur Per-Head Muon, activation SiTU |
| Licence (27 juill.) | Modified MIT — vérifier le texte LICENSE le jour J |
Employez open weights dans les titres, pas open source. La distinction compte sur r/LocalLLaMA et Hacker News — et cible la requête à forte intention « kimi k3 open weights ».
Benchmarks Kimi K3 : comparaison avec Claude Fable 5 et GPT-5.6
Données recoupées depuis Artificial Analysis (16 juill.) et les supports Moonshot. Les benchmarks passent par des harness différents — toujours citer source et date.
| Modèle | Index AA Intelligence | Rang |
|---|---|---|
| Claude Fable 5 | 59,9 | #1 |
| GPT-5.6 Sol | 58,9 | #2 |
| Kimi K3 | 57,1 | #3 / 189 |
Domaines où K3 mène ou égalise :
Frontend Code Arena : #1 — préférence aveugle des développeurs pour le code UI face à Fable et Sol
Automation Bench, SpreadsheetBench 2 : #1
BrowseComp : 91,2 (#1) — 90,4+ avec stratégie 1M sans compression
SWE Marathon : 42,0 — large avance (GPT-5.5 / GLM-5.2 retombent dans les dizaines basses)
Terminal Bench 2.1 : 88,3 — quasi-parité avec Sol (88,8)
Program Bench : 77,8 — devant Sol (77,6)
FrontierSWE : 81,2 — bat Sol (71,3), derrière Fable 5 (86,6)
Domaines où K3 reste en retrait :
GDPval v2 Elo : 1668–1687 vs Fable 5 (1760), Sol (1748) — jugement long terme reste territoire Fable
DeepSWE : 67,5 vs Sol 73,0
Taux d'hallucination en hausse vs K2.6 (reconnu par l'éditeur) ; Reddit signale plus d'hallucinations que les modèles fermés en self-hosting
Finition conversationnelle et variance de session inférieures à Fable 5 / Sol
| Dimension | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Intelligence Index | 57,1 (#3) | 59,9 (#1) | 58,9 (#2) |
| Coût par tâche (AA) | 0,94 $ | ~2,75 $ | ~1,04 $ |
| vs Fable 5 | 65,8 % moins cher ; 9,4 % sous Sol | ||
| Open weights | 27 juill. | Fermé | Fermé |
| Contexte | 1M tokens | ~200K | 128K–1M selon tier |
Tarifs API Kimi K3 et checklist du 27 juillet
Tarification alignée sur les API de qualité occidentale — la plus élevée parmi les éditeurs chinois, mais bien en dessous du coût par tâche de Claude Opus 4.8. Les charges de codage affichent plus de 90 % de cache hit, réduisant la facture effective.
| Poste | Prix (par 1M tokens) |
|---|---|
| Entrée (cache miss) | 3,00 $ |
| Entrée (cache hit, automatique) | 0,30 $ |
| Sortie | 15,00 $ |
Ce qui se passe le 27 juillet — checklist en six étapes :
Poids complets 2,8T sur l'organisation Hugging Face Moonshot sous Modified MIT (termes à confirmer)
Rapport technique — architecture, entraînement, évaluation
Écosystème vLLM — support KDA + prefix caching livré avec les poids
Extensions communautaires — builds Ollama et GGUF attendus comme la série K2
Vérifier le texte LICENSE — périmètre de redistribution commerciale le jour J
Retest long contexte indépendant — recouper benchmarks communautaires et chiffres officiels
Sources : kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis (16 juill.), VentureBeat, analyse Northflank self-hosting, r/LocalLLaMA, Hacker News.
Exécuter Kimi K3 en local ? Matériel requis et impact sectoriel
Pas sur matériel grand public. Poids 4-bit ~1,4 To. Moonshot recommande un super-nœud 64+ accélérateurs avec parallélisme expert et tensoriel. Référence : K2.7 Code (1T paramètres) exigeait ~577 Go VRAM en INT4 ; K3 est 2,8× cette échelle.
Pour la majorité des équipes : API (3 $/15 $). L'auto-hébergement se justifie pour la souveraineté des données, le fine-tuning sur données propriétaires, ou des volumes où l'infrastructure détenue bat la facture cloud.
2,8T paramètres, 896 experts / 16 actifs, contexte 1M — ligne de référence
~1,4 To en 4-bit ; 64+ accélélateurs recommandés — tout titre « sur votre portable » relève du clickbait
Frontend Code Arena #1 ; SWE Marathon 42,0 — leadership coding longues sessions face aux modèles fermés
Impact sectoriel — quatre axes :
Écart open vs closed quasi comblé au frontier — de fossés en points de pourcentage à 2–3 points d'index ; premium modèle fermé plus difficile à justifier sur la seule capacité
Narratif réglementaire — poids publiés survivent aux interdictions d'API
Vague d'éditeurs chinois — GLM-5.2, DeepSeek V4 Pro, MiniMax ; K3 marque le pic paramétrique
Reset stratégique Moonshot — cadence open weights après la disruption DeepSeek R1
Maintenir un cluster d'inférence 64 GPU implique des coûts opérationnels cachés — énergie, réseau, verrouillage de versions, astreinte. Si votre équipe a besoin d'hôtes Mac stables pour CI/CD iOS et orchestration d'agents IA tout en appelant K3 via API, la location cloud Mac Mini MESHLAUNCH est généralement la voie production la plus fiable : Apple Silicon dédié, disponibilité 24/7, formules journalière/hebdomadaire/mensuelle. Tarifs : grille de location ; assistance : centre d'aide.
27 juillet 2026 sur Hugging Face Moonshot. API en ligne depuis le 16 juillet — deux jalons distincts (téléchargement vs appel).
Le 27 juillet apporte des open weights, pas un open source complet (pas de code ni données d'entraînement). Lire les termes Modified MIT le jour J. Profondeur architecture : test Kimi K3.
3 $/M entrée, 0,30 $/M en cache, 15 $/M sortie. ~0,94 $ par tâche en tests AA. Environnements agent : tarifs location.
Non. ~1,4 To en 4-bit exige un cluster GPU datacenter. Attendre les builds GGUF distillés communautaires — avec des compromis majeurs sur les capacités.
Index global : non (#3). Bancs coding et automation : souvent oui. Raisonnement long et stabilité : territoire Fable/Sol. Moonshot l'affirme publiquement. Setup hybride : centre d'aide.