Kimi K3 Release: API-Launch vs Open-Weights-Drop
Am 16. Juli 2026 lieferte Moonshot Kimi K3 über Kimi App, Kimi Work, Kimi Code und API aus. Artificial Analysis veröffentlichte am selben Tag eine unabhängige Bewertung. Am 27. Juli gehen vollständige Modellgewichte (Modified MIT) plus technischer Report (Architektur, Training, Evaluation) auf Hugging Face online.
Kernbefund: K3 ist kein Fable-5-Killer. AA Intelligence Index 57,1, Rang #3 von 189, hinter Claude Fable 5 (59,9) und GPT-5.6 Sol (58,9). Es liefert nahe-Frontier-Fähigkeit bei etwa einem Drittel der Kosten plus zwei Dinge, die geschlossene Modelle nicht bieten: herunterladbare Open Weights und 1M-Token-Kontext.
| Datum | Ereignis |
|---|---|
| 2026-07-16 | K3-API und Kimi-Produktsuite; Artificial-Analysis-Benchmark |
| 2026-07-17 | WAIC-Eröffnung Shanghai; Staatsmedien rahmen K3 als nationalen KI-Meilenstein |
| 2026-07-27 | Vollständige Gewichte auf Hugging Face (Modified MIT) + technischer Report |
API jetzt nutzbar: Modell-ID kimi-k3 auf platform.kimi.ai — kein Warten auf Gewichte nötig.
Gewichte ≠ sofort lokal: vLLM-Support für KDA und Prefix-Caching kommt mit dem Weight-Release; Ollama- und GGUF-Ports folgen K2-Muster.
Ungewöhnlich ehrlicher Vendor: Moonshot räumt Rückstand zu Fable 5 und Sol ein — Harness-Sensitivität und übereifrige Antworten bei vagen Prompts.
Regulatorischer Kontext: Release-Timing passt zur WAIC. US-Regulatoren zogen Anthropic Fable/Mythos im Juni kurz zurück (Wiederherstellung 1.7.) — Narrativ: API-Sperren treffen geschlossene Modelle, nicht veröffentlichte Gewichte.
Moonshot-Comeback: Nach DeepSeek R1 (Marktanteil Anfang 2025 auf #7) baute die K2 → K2.5 → K3 Open-Weight-Roadmap Vertrauen wieder auf.
Was ist Kimi K3? Specs auf einen Blick
K3 nutzt Stable LatentMoE: 896 Experten, 16 pro Token aktiv (~1,8 % Sparsity). Attention-Stack: Kimi Delta Attention (KDA, hybride lineare Attention) + Attention Residuals (AttnRes) + Gated MLA. Gewichte als MXFP4, Aktivierungen MXFP8 (Low-Precision-Training). Skalierungseffizienz ~2,5× besser als K2; KDA liefert bis zu 6,3× Decode-Speedup bei 1M Kontext.
| Spec | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen — größtes Open-Weight-Modell bisher |
| Architektur | Sparse MoE: Stable LatentMoE, 896 Experten / 16 aktiv pro Token |
| Attention | KDA + AttnRes + Gated MLA |
| Kontextfenster | 1.048.576 Tokens (1M) |
| Modalitäten | Native Vision (Text + Bild; Video im Produkt), Text-Output |
| Gewichtsformat | MXFP4-Gewichte + MXFP8-Aktivierungen |
| Training-Stabilität | Quantile Balancing, Per-Head Muon Optimizer, SiTU-Aktivierung |
| Lizenz (27.7.) | Modified MIT — LICENSE am Release-Tag prüfen |
In Headlines Open Weights schreiben, nicht Open Source. Die Unterscheidung zählt — und trifft die High-Intent-Suche „kimi k3 open weights". Für EU-Unternehmen mit DSGVO Art. 44 ff. ist Self-Hosting der einzige Weg, Prompts und Outputs garantiert in der EU zu halten — sofern die Infrastruktur dort steht.
Kimi K3 Benchmarks: Vergleich mit Claude Fable 5 und GPT-5.6
Daten aus Artificial Analysis (16.7.) und Moonshot-Materialien, querverifiziert. Benchmarks laufen über unterschiedliche Harnesses — Quelle und Datum immer mitangeben.
| Modell | AA Intelligence Index | Rang |
|---|---|---|
| Claude Fable 5 | 59,9 | #1 |
| GPT-5.6 Sol | 58,9 | #2 |
| Kimi K3 | 57,1 | #3 / 189 |
Wo K3 gewinnt oder gleichzieht:
Frontend Code Arena: #1 — blinde Dev-Präferenz für UI-Code vor Fable und Sol
Automation Bench, SpreadsheetBench 2: #1
BrowseComp: 91,2 (#1) — 90,4+ mit 1M-Kontext ohne Kompression
SWE Marathon: 42,0 — weit voraus (GPT-5.5 / GLM-5.2 im niedrigen Zehnerbereich)
Terminal Bench 2.1: 88,3 — nahe Sol (88,8)
Program Bench: 77,8 — knapp vor Sol (77,6)
FrontierSWE: 81,2 — schlägt Sol (71,3), hinter Fable 5 (86,6)
Wo K3 noch hinterherhinkt:
GDPval v2 Elo: 1668–1687 vs Fable 5 (1760), Sol (1748) — Langstrecken-Urteil bleibt Fable-Territorium
DeepSWE: 67,5 vs Sol 73,0
Halluzinationsrate vs K2.6 gestiegen (vom Vendor bestätigt); Reddit berichtet mehr Halluzinationen als Top-Closed-Modelle bei Self-Hosting
Gesprächspolish und Session-Varianz unter Fable 5 / Sol
| Dimension | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol |
|---|---|---|---|
| Intelligence Index | 57,1 (#3) | 59,9 (#1) | 58,9 (#2) |
| Kosten pro Aufgabe (AA) | 0,94 $ | ~2,75 $ | ~1,04 $ |
| vs Fable 5 | 65,8 % günstiger; 9,4 % unter Sol | ||
| Open Weights | 27.7. | Geschlossen | Geschlossen |
| Kontext | 1M Tokens | ~200K-Klasse | 128K–1M je Tier |
Kimi K3 API-Preise und Release-Checkliste 27.7.
Preise auf Western-Quality-Tier-Niveau — höchste unter chinesischen Anbietern, dennoch deutlich unter Claude Opus 4.8 pro Aufgabe. Coding-Workloads melden 90 %+ Cache-Treffer, was effektive Kosten senkt. DSGVO-Hinweis: API-Nutzung über platform.kimi.ai kann personenbezogene Daten Drittstaaten überlassen — Auftragsverarbeitungsvertrag und Transfer-Impact-Assessment vor Produktionseinsatz prüfen.
| Posten | Preis (pro 1M Tokens) |
|---|---|
| Input (Cache-Miss) | 3,00 $ |
| Input (Cache-Treffer, automatisch) | 0,30 $ |
| Output | 15,00 $ |
Was am 27. Juli passiert — Sechs-Schritte-Checkliste:
Vollständige 2,8T-Gewichte auf Moonshot Hugging Face unter Modified MIT (Bedingungen TBC)
Technischer Report — Architektur, Training, Evaluationsdetails
vLLM-Ökosystem — KDA + Prefix-Caching mit Gewichten
Community-Follow-ons — Ollama, GGUF-Quants wie K2-Serie erwartet
LICENSE-Text prüfen — kommerzieller Weitervertrieb am Release-Tag
Unabhängiger Langkontext-Retest — Community-Benchmarks gegen offizielle Zahlen
Quellen: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis (16.7.), VentureBeat, Northflank Self-Hosting-Analyse, r/LocalLLaMA, Hacker News.
Kimi K3 lokal betreiben? Hardware und Branchenwirkung
Nicht auf Consumer-Hardware. 4-Bit-Gewichte ca. 1,4 TB. Moonshot empfiehlt Super-Node mit 64+ Beschleunigern, Expert-Parallelismus plus Tensor-Parallelismus. Referenz: K2.7 Code (1T Parameter) brauchte ~577 GB VRAM bei INT4; K3 ist 2,8× dieser Skala.
Für die meisten Teams: API (3 $/15 $). Self-Hosting lohnt bei strikter Datensouveränität (DSGVO Art. 32), Fine-Tuning auf proprietären Daten oder Volumen, wo eigene Hardware Cloud-Rechnungen schlägt — vorausgesetzt Rechenzentrum und Betrieb liegen in der EU.
2,8T Parameter, 896 Experten / 16 aktiv, 1M Kontext — Referenzzeile eins
~1,4 TB bei 4-Bit; 64+ Beschleuniger empfohlen — jede „auf dem Laptop"-Headline ist Clickbait
Frontend Code Arena #1; SWE Marathon 42,0 — Coding-Vorsprung bei Langsessions
Branchenwirkung — vier Datenpunkte:
Open-vs-Closed-Lücke fast geschlossen — von Prozentpunkten zu 2–3 Index-Punkten; Closed-Premium allein schwerer zu rechtfertigen
Regulatorisches Narrativ — veröffentlichte Gewichte überleben API-Sperren
Chinesische Anbieterwelle — GLM-5.2, DeepSeek V4 Pro, MiniMax; K3 ist der Parameter-Peak
Moonshot-Strategie-Reset — Open-Weight-Kadenz nach DeepSeek-R1-Disruption
Ein 64-GPU-Inferenz-Cluster hat versteckte Ops-Kosten — Strom, Netzwerk, Version-Pinning, On-Call. Wer stabile Mac-Hosts für iOS-CI/CD und KI-Agent-Orchestrierung braucht und K3 per API aufruft, ist mit MESHLAUNCH Cloud-Mac-Mini-Miete meist auf dem besseren Produktionspfad: dediziertes Apple Silicon, 7×24 online, flexible Tages-/Wochen-/Monatsmiete. Kapazität: Mietpreise; Ersthelfer: Hilfezentrum.
27. Juli 2026 auf Moonshot Hugging Face. API seit 16. Juli live — zwei verschiedene Meilensteine (Download vs Aufruf).
27.7. liefert Open Weights, nicht vollständig Open Source (kein Trainingscode/Daten). Modified-MIT-Bedingungen am Release-Tag lesen. Architektur-Tiefe: Kimi-K3-Test.
3 $/M Input, 0,30 $/M gecacht, 15 $/M Output. ~0,94 $ pro Aufgabe in AA-Tests. Agent-Dev-Umgebungen: Mietpreise.
Nein. ~1,4 TB bei 4-Bit braucht Rechenzentrum-GPU-Cluster. Auf destillierte GGUF-Builds warten — mit erheblichen Capability-Trade-offs. Self-Hosting in der EU: DSGVO-konforme Infrastruktur vorab planen.
Gesamtindex: nein (#3). Coding- und Automation-Benches: oft ja. Langstrecken-Reasoning und Stabilität: Fable/Sol-Territorium. Moonshot sagt das öffentlich. Hybrid-Setup: Hilfezentrum.