Kimi K3 Open Weight: Warum dieser Release zählt
Kimi K3 ist ein Mixture-of-Experts-Modell (MoE) mit 2,8 Billionen Gesamtparametern, etwa 104 Milliarden aktivierten Parametern pro Token, 1-Million-Token-Kontextfenster und nativer Bildverarbeitung. Die Gewichtsdateien auf Hugging Face umfassen rund 1,56 TB; innerhalb von 30 Minuten nach Veröffentlichung stand K3 auf Platz 1 der Trending-Liste. Zwischen API-Launch und vollständiger Gewichtsfreigabe lagen nur 11 Tage.
16. Juli (Vorabend WAIC 2026): Kimi K3 startet auf kimi.com, Kimi Work, Kimi Code und der Kimi API — nur Online-Zugriff, keine Gewichte. Technikblog-Titel: «Kimi K3: Open Frontier Intelligence».
17. Juli: Branchenanalysen zur KDA/AttnRes-Architektur; staatliche Medien berichten über das «größte Open-Weight-Modell weltweit».
22.–23. Juli: US-China-«Destillations»-Streit eskaliert. White-House-Berater Michael Kratsios wirft Moonshot «industrielle Destillation» von Anthropics Fable-Modell vor; Finanzminister Scott Bessent kündigt Sanktionsprüfung an.
27. Juli, 23:00 Uhr: Moonshot veröffentlicht vollständige K3-Gewichte, Technikbericht und open-sourct MoonEP sowie AgentEnv (FlashKDA war bereits freigegeben).
28. Juli: Chinesisches Handelsministerium reagiert auf US-KI-Sanktionsdrohungen; internationale Medien berichten über Lizenzdetails und Benchmarks.
Drei Tage später kündigte Alibaba (Investor von Moonshot) Qwen3.8-Max-Preview mit 24 Billionen Parametern an — als direkte Antwort auf K3 interpretiert. Die chinesische Frontier-KI-Konkurrenz tritt in die «3T-Klasse» ein.
Kernparameter und Benchmarks: K3 vs. GPT-5.6 und Claude
Benchmark-Zahlen variieren je nach Framework und Reproduktion. Nachfolgend bevorzugt unabhängige Drittquellen; Herstellerangaben sind separat gekennzeichnet.
| Parameter | Kimi K3 | Anmerkung |
|---|---|---|
| Gesamtparameter | 2,8 Billionen (2,8T) | Erstes vollständig freigegebenes 3T-Modell |
| Aktivierte Parameter | ca. 104 Mrd. | MoE-Sparse-Aktivierung |
| Expertenkonfiguration | 896 Routing-Experten, 16 pro Token | Sparsity ca. 1,8 % |
| Kontextfenster | 1.000.000 Token | KDA + Gated MLA Hybrid-Attention |
| Gewichtsvolumen | ca. 1,56 TB | MXFP4-Gewichte + MXFP8-Aktivierung |
| Lizenz | Custom Open Weight | Offiziell «open weight», nicht «open source» |
SWE-bench Verified (unabhängige Reproduktion, Vals AI, Stand Juli 2026)
| Modell | Score | Release |
|---|---|---|
| Claude Opus 5 | 97 % | 2026-07-24 |
| GPT-5.6 Sol | 96,2 % | 2026-07-09 |
| Claude Fable 5 | 95 % | 2026-06-09 |
| Kimi K3 | 93,4 % | 2026-07-16 |
| Qwen3.7-Max | 79,4 % | 2026-05-19 |
| DeepSeek-V4 | 76,2 % | 2026-04-23 |
Kimi K3 ist die leistungsstärkste Option unter Open Weights — nicht die kostengünstigste. Artificial Analysis Intelligence Index: global Rang 3, Open Weights Rang 1; Kosten pro Aufgabe ca. $0,95 vs. GLM-5.2 ca. $0,47.
KDA, AttnRes, Per-Head Muon und drei Open-Infra-Projekte
Kimi K3 überarbeitet drei etablierte Deep-Learning-Komponenten — Attention, Residualverbindungen und Optimizer. Das unterscheidet K3 von reinem Parameterskalieren.
Kimi Delta Attention (KDA) ersetzt das skalare Vergessungstor des Gated DeltaNet durch kanalweise Decay-Raten: Jede Feature-Dimension erhält eine eigene Abklingrate, implementiert als chunkweises DPLR-Rekursionsverfahren in linearer Zeit. K3 wechselt KDA mit wenigen globalen Gated-MLA-Schichten ab — 1M-Token-Kontext bei minimalem KV-Cache-Overhead.
Attention Residuals (AttnRes) ersetzen statische Residualverbindungen durch selektive, eingabeabhängige Aggregation aller vorherigen Layer-Ausgaben. Pro Layer: ein RMSNorm und ein Pseudo-Query-Vektor — ca. 25 % Trainingseffizienzgewinn bei unter 2 % Overhead.
Per-Head Muon lässt jeden Attention-Head unabhängig konvergieren. Zusammen mit Stable LatentMoE (896-zu-16-Sparse-Routing + Quantile Balancing) beweist Moonshot eine theoretische Obergrenze redundanter Experten pro Rechenknoten.
| Technologie | Funktion | Kernfähigkeit |
|---|---|---|
| MoonEP | Feingranulare MoE-Kommunikation auf Supernode-Skala | Temporäre Replikation überlasteter Experten; gleichmäßige Token-Verteilung pro Knoten; theoretische Obergrenze redundanter Experten |
| FlashKDA | CUTLASS-basierter KDA-Hochleistungsoperator | H20-Prefill 1,72–2,22× schneller; chunk_kda-Backend-Drop-in |
| AgentEnv | Firecracker-microVM-Agenten-Sandbox | Checkpoint-Latenz 133 ms, Recovery 49 ms, Memory-Overcommit bis 6,5× (Herstellerangaben, noch nicht unabhängig verifiziert) |
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
Hinweis: Moonshot liefert nicht nur Gewichte, sondern auch die drei Infrastrukturprojekte, die K3s Trainingseffizienz und Stabilität ermöglichen — ein zentraler Grund für die positive Entwickler-Community-Reaktion.
Kimi K3 Anbindung und Deployment: Sechs-Schritte-Runbook
Pfad festlegen: API-Aufruf, OpenRouter-Drittanbieter oder Self-Hosting auf 64+-GPU-Supernode evaluieren. Für Einzelentwickler und KMU ist API oder OpenRouter der realistische Weg.
Moonshot API registrieren: API-Key unter https://api.moonshot.ai/v1 anlegen. Modell-ID: kimi-k3. OpenAI-SDK-kompatibel — bestehende Projekte benötigen nur neuen Base-URL und Key.
Cache-Strategie konfigurieren: Mooncake-Disaggregated-Inference erreicht bei Coding-Workloads über 90 % Cache-Treffer — effektive Input-Kosten näher $0,30/M statt $3,00/M.
Self-Hosting prüfen (optional): Gewichte von Hugging Face moonshotai/Kimi-K3 laden (ca. 1,56 TB). Supernode mit 64+ Beschleunigerkarten, Expert-Parallel und Tensor-Parallel vorbereiten.
Lizenz prüfen: MaaS-Jahresumsatz über $20 Mio. oder MAU über 100 Mio. / Monatsumsatz über $20 Mio.? Zusätzliche Lizenzbedingungen beachten.
Infra-Toolchain integrieren: Für KDA-Operatoren flash-linear-attention-Backend auf FlashKDA chunk_kda umstellen. Agent-RL-Training: AgentEnv-Sandbox evaluieren.
Lizenzschwellen und API-Preisdaten
Open Weight vs. Open Source: Moonshot verwendet durchgängig «open weight», nie «open source». Nach OSI-Definition sind Gewichte, Technikbericht und Inferenz-Infra öffentlich; Trainingsdaten und vollständiger Trainingscode fehlen.
MaaS-Umsatzschwelle $20 Mio.: Betreibt ihr Model-as-a-Service mit über $20 Mio. kumuliertem Umsatz in 12 Monaten, ist eine separate kommerzielle Vereinbarung mit Moonshot erforderlich.
API-Preise (pro 1M Token): Input Cache-Hit $0,30, Cache-Miss $3,00, Output (inkl. Reasoning) $15,00. Artificial Analysis: ca. $0,95/Aufgabe — ca. 60 % günstiger als Claude Fable 5 (ca. $2,40/Aufgabe).
Achtung: 2,8 Billionen Parameter und 896 Experten machen Consumer-Hardware-Deployment unrealistisch. OpenRouter listet K3 bereits bei sieben Anbietern — Preise meist identisch mit Moonshot-API. Bei DSGVO-relevanten Produktionsdaten: Datenverarbeitung in Drittländern und fehlende EU-Region vor Go-Live prüfen.
Wer Agent-Orchestrierung, CI/CD-Pipelines oder dauerhafte Gateway-Prozesse lokal auf dem Mac betreibt, stößt bei K3-Self-Hosting an Hardwaregrenzen; lokale Macs unterbrechen lange Agent-Loops durch Ruhezustand und Speicherengpässe. Für 7×24 iOS-CI/CD und Agent-Automatisierung ist MESHLAUNCH Mac Mini Cloud Bare-Metal die stabilere Basis: dediziertes Apple Silicon, flexible Tages-/Wochen-/Monats-Tarife — Inferenz über API, Orchestrierung und Builds auf stabilen Cloud-Mac-Knoten mit Metal-Grafik-API-Fidelity. Mietpreise und Hilfezentrum.
Nein im OSI-Sinne. Kimi K3 ist ein «Open-Weight»-Modell: fertige Gewichte, Technikbericht und Teile der Infra sind öffentlich; Trainingsdaten und vollständiger Trainingscode fehlen. Hintergrund: Kimi K3 Test 2026.
Ja, in den meisten Fällen ohne Einschränkung. Ausnahme: MaaS-Anbieter mit über $20 Mio. Jahresumsatz oder Produkte mit über 100 Mio. MAU bzw. $20 Mio. Monatsumsatz. Cloud-Entwicklungsumgebung: Mietpreise.
Moonshot empfiehlt mindestens 64 Beschleunigerkarten auf einem Supernode. Für die meisten Teams: API oder OpenRouter. Repository-Setup und Cloud-Mac-Konfiguration: Hilfezentrum.
SWE-bench Verified: 93,4 %. Artificial Analysis Intelligence Index: global Rang 3, Open Weights Rang 1 — hinter Claude Fable 5 und GPT-5.6 Sol, teurer als GLM-5.2. Destillationskontext: Claude Opus 5 vs. Kimi K3.
K3 hat etwa dreifache Parameterzahl gegenüber K2.5, neue Attention Residuals und Per-Head Muon, 1M-Token-Kontext und native Vision. Erstmals $20M-MaaS-Umsatzschwelle in der Lizenz. Release-Details: Open Weights Release 27.7.