Kimi K3 open weights
Date de publication, benchmarks et déploiement

16 juill. API · 27 juill. Modified MIT · 2,8T · index 57,1 · 0,94 $/tâche · réalité 1,4 To

Publication open weights Kimi K3 27 juillet 2026 comparaison benchmarks
Moonshot AI publiera le 27 juillet 2026 l'intégralité des poids de Kimi K3 — modèle MoE de 2,8 billions de paramètres avec fenêtre de contexte de 1 million de tokens (1 048 576) — sous licence Modified MIT. L'API est en ligne depuis le 16 juillet. Que vous attendiez la plus grande publication open weights de l'histoire, compariez K3 à Claude Fable 5 et GPT-5.6 Sol, ou évaluiez l'auto-hébergement face à l'API, ce guide couvre : ① la distinction 16/27 juillet ; ② l'index AA Intelligence 57,1 et les tableaux complets ; ③ le coût API réel avec cache (0,94 $/tâche, 65,8 % sous Fable 5) ; ④ pourquoi 1,4 To en 4-bit ne tient pas sur un portable.
01

Date de publication Kimi K3 : lancement API vs dépôt des poids

Le 16 juillet 2026, Moonshot a déployé Kimi K3 via Kimi App, Kimi Work, Kimi Code et l'API. Artificial Analysis a publié une évaluation indépendante le même jour. Le 27 juillet, les poids complets (Modified MIT) et un rapport technique (architecture, entraînement, évaluation) seront disponibles sur Hugging Face.

Conclusion : K3 n'est pas un tueur de Fable 5. L'index AA Intelligence 57,1 le place #3 sur 189, derrière Claude Fable 5 (59,9) et GPT-5.6 Sol (58,9). Il offre une capacité proche du frontier à environ un tiers du coût, plus deux atouts impossibles en modèle fermé : poids téléchargeables et contexte 1M tokens.

DateÉvénement
2026-07-16Lancement API K3 et suite Kimi ; benchmarks Artificial Analysis
2026-07-17Ouverture WAIC à Shanghai ; médias d'État présentent K3 comme jalon national
2026-07-27Poids complets sur Hugging Face (Modified MIT) + rapport technique
01

API disponible dès maintenant : identifiant kimi-k3 sur platform.kimi.ai — pas besoin d'attendre les poids pour développer.

02

Poids ≠ exécution locale immédiate : le support vLLM pour KDA et le prefix caching arrive avec la publication ; ports Ollama et GGUF suivront le modèle K2.

03

Position éditoriale remarquable : Moonshot reconnaît publiquement son retard face à Fable 5 et Sol — sensibilité aux harness et réponses trop proactives sur prompts ambigus.

04

Contexte géopolitique : calendrier aligné sur le WAIC. Régulateurs US ont brièvement retiré Fable/Mythos d'Anthropic en juin (rétablis le 1er juillet) — narrative : on peut bloquer une API fermée, pas des poids publiés.

05

Retour de Moonshot : après DeepSeek R1 (part de marché tombée à #7 domestiquement début 2025), la feuille de route K2 → K2.5 → K3 a restauré la crédibilité open weights.

02

Qu'est-ce que Kimi K3 ? Spécifications essentielles

K3 repose sur Stable LatentMoE : 896 experts, 16 activés par token (~1,8 % de sparsité). Stack d'attention : Kimi Delta Attention (KDA, attention linéaire hybride) + Attention Residuals (AttnRes) + Gated MLA. Poids en MXFP4, activations MXFP8 (entraînement basse précision native). Efficacité de scaling ~2,5× supérieure à K2 ; KDA apporte jusqu'à 6,3× d'accélération decode à 1M de contexte.

SpécificationValeur
Paramètres totaux2,8 billions — plus grand modèle open weights à ce jour
ArchitectureMoE sparse : Stable LatentMoE, 896 experts / 16 actifs par token
AttentionKDA + AttnRes + Gated MLA
Fenêtre de contexte1 048 576 tokens (1M)
ModalitésVision native (texte + image ; vidéo en produit), sortie texte
Format des poidsMXFP4 + activations MXFP8
Stabilité d'entraînementQuantile Balancing, optimiseur Per-Head Muon, activation SiTU
Licence (27 juill.)Modified MIT — vérifier le texte LICENSE le jour J

Employez open weights dans les titres, pas open source. La distinction compte sur r/LocalLLaMA et Hacker News — et cible la requête à forte intention « kimi k3 open weights ».

03

Benchmarks Kimi K3 : comparaison avec Claude Fable 5 et GPT-5.6

Données recoupées depuis Artificial Analysis (16 juill.) et les supports Moonshot. Les benchmarks passent par des harness différents — toujours citer source et date.

ModèleIndex AA IntelligenceRang
Claude Fable 559,9#1
GPT-5.6 Sol58,9#2
Kimi K357,1#3 / 189

Domaines où K3 mène ou égalise :

Frontend Code Arena : #1 — préférence aveugle des développeurs pour le code UI face à Fable et Sol

Automation Bench, SpreadsheetBench 2 : #1

BrowseComp : 91,2 (#1) — 90,4+ avec stratégie 1M sans compression

SWE Marathon : 42,0 — large avance (GPT-5.5 / GLM-5.2 retombent dans les dizaines basses)

Terminal Bench 2.1 : 88,3 — quasi-parité avec Sol (88,8)

Program Bench : 77,8 — devant Sol (77,6)

FrontierSWE : 81,2 — bat Sol (71,3), derrière Fable 5 (86,6)

Domaines où K3 reste en retrait :

GDPval v2 Elo : 1668–1687 vs Fable 5 (1760), Sol (1748) — jugement long terme reste territoire Fable

DeepSWE : 67,5 vs Sol 73,0

Taux d'hallucination en hausse vs K2.6 (reconnu par l'éditeur) ; Reddit signale plus d'hallucinations que les modèles fermés en self-hosting

Finition conversationnelle et variance de session inférieures à Fable 5 / Sol

DimensionKimi K3Claude Fable 5GPT-5.6 Sol
Intelligence Index57,1 (#3)59,9 (#1)58,9 (#2)
Coût par tâche (AA)0,94 $~2,75 $~1,04 $
vs Fable 565,8 % moins cher ; 9,4 % sous Sol
Open weights27 juill.FerméFermé
Contexte1M tokens~200K128K–1M selon tier
04

Tarifs API Kimi K3 et checklist du 27 juillet

Tarification alignée sur les API de qualité occidentale — la plus élevée parmi les éditeurs chinois, mais bien en dessous du coût par tâche de Claude Opus 4.8. Les charges de codage affichent plus de 90 % de cache hit, réduisant la facture effective.

PostePrix (par 1M tokens)
Entrée (cache miss)3,00 $
Entrée (cache hit, automatique)0,30 $
Sortie15,00 $

Ce qui se passe le 27 juillet — checklist en six étapes :

01

Poids complets 2,8T sur l'organisation Hugging Face Moonshot sous Modified MIT (termes à confirmer)

02

Rapport technique — architecture, entraînement, évaluation

03

Écosystème vLLM — support KDA + prefix caching livré avec les poids

04

Extensions communautaires — builds Ollama et GGUF attendus comme la série K2

05

Vérifier le texte LICENSE — périmètre de redistribution commerciale le jour J

06

Retest long contexte indépendant — recouper benchmarks communautaires et chiffres officiels

Sources : kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis (16 juill.), VentureBeat, analyse Northflank self-hosting, r/LocalLLaMA, Hacker News.

05

Exécuter Kimi K3 en local ? Matériel requis et impact sectoriel

Pas sur matériel grand public. Poids 4-bit ~1,4 To. Moonshot recommande un super-nœud 64+ accélérateurs avec parallélisme expert et tensoriel. Référence : K2.7 Code (1T paramètres) exigeait ~577 Go VRAM en INT4 ; K3 est 2,8× cette échelle.

Pour la majorité des équipes : API (3 $/15 $). L'auto-hébergement se justifie pour la souveraineté des données, le fine-tuning sur données propriétaires, ou des volumes où l'infrastructure détenue bat la facture cloud.

A

2,8T paramètres, 896 experts / 16 actifs, contexte 1M — ligne de référence

B

~1,4 To en 4-bit ; 64+ accélélateurs recommandés — tout titre « sur votre portable » relève du clickbait

C

Frontend Code Arena #1 ; SWE Marathon 42,0 — leadership coding longues sessions face aux modèles fermés

Impact sectoriel — quatre axes :

1

Écart open vs closed quasi comblé au frontier — de fossés en points de pourcentage à 2–3 points d'index ; premium modèle fermé plus difficile à justifier sur la seule capacité

2

Narratif réglementaire — poids publiés survivent aux interdictions d'API

3

Vague d'éditeurs chinois — GLM-5.2, DeepSeek V4 Pro, MiniMax ; K3 marque le pic paramétrique

4

Reset stratégique Moonshot — cadence open weights après la disruption DeepSeek R1

Maintenir un cluster d'inférence 64 GPU implique des coûts opérationnels cachés — énergie, réseau, verrouillage de versions, astreinte. Si votre équipe a besoin d'hôtes Mac stables pour CI/CD iOS et orchestration d'agents IA tout en appelant K3 via API, la location cloud Mac Mini MESHLAUNCH est généralement la voie production la plus fiable : Apple Silicon dédié, disponibilité 24/7, formules journalière/hebdomadaire/mensuelle. Tarifs : grille de location ; assistance : centre d'aide.

FAQ

27 juillet 2026 sur Hugging Face Moonshot. API en ligne depuis le 16 juillet — deux jalons distincts (téléchargement vs appel).

Le 27 juillet apporte des open weights, pas un open source complet (pas de code ni données d'entraînement). Lire les termes Modified MIT le jour J. Profondeur architecture : test Kimi K3.

3 $/M entrée, 0,30 $/M en cache, 15 $/M sortie. ~0,94 $ par tâche en tests AA. Environnements agent : tarifs location.

Non. ~1,4 To en 4-bit exige un cluster GPU datacenter. Attendre les builds GGUF distillés communautaires — avec des compromis majeurs sur les capacités.

Index global : non (#3). Bancs coding et automation : souvent oui. Raisonnement long et stabilité : territoire Fable/Sol. Moonshot l'affirme publiquement. Setup hybride : centre d'aide.