Kimi K3 Open Weight
2,8 Billionen Parameter · 1M Kontext

11 Tage API bis Gewichte · KDA/AttnRes/MoE · Lizenzschwellen · Benchmarks · Runbook

Kimi K3 Open Weight: 2,8 Billionen Parameter und 1-Million-Token-Kontext
Am 27. Juli 2026 gegen 23:00 Uhr Pekinger Zeit veröffentlichte Moonshot AI (月之暗面) die vollständigen Kimi K3-Modellgewichte, den Technikbericht und drei Kern-Infrastrukturprojekte — MoonEP, FlashKDA und AgentEnv. Damit steht das weltweit erste vollständig freigegebene Modell im 3-Billionen-Parameter-Bereich zum Download bereit. Dieser Leitfaden richtet sich an Teams, die K3 für API-Integration, Self-Hosting oder kommerzielle Nutzung evaluieren: 11-Tage-Zeitachse, Architekturinnovationen KDA/AttnRes, unabhängige Benchmarks, $20M-MaaS-Lizenzschwelle und ein Sechs-Schritte-Runbook — inklusive DSGVO-Hinweis bei Cloud-API-Datenverarbeitung.
01

Kimi K3 Open Weight: Warum dieser Release zählt

Kimi K3 ist ein Mixture-of-Experts-Modell (MoE) mit 2,8 Billionen Gesamtparametern, etwa 104 Milliarden aktivierten Parametern pro Token, 1-Million-Token-Kontextfenster und nativer Bildverarbeitung. Die Gewichtsdateien auf Hugging Face umfassen rund 1,56 TB; innerhalb von 30 Minuten nach Veröffentlichung stand K3 auf Platz 1 der Trending-Liste. Zwischen API-Launch und vollständiger Gewichtsfreigabe lagen nur 11 Tage.

01

16. Juli (Vorabend WAIC 2026): Kimi K3 startet auf kimi.com, Kimi Work, Kimi Code und der Kimi API — nur Online-Zugriff, keine Gewichte. Technikblog-Titel: «Kimi K3: Open Frontier Intelligence».

02

17. Juli: Branchenanalysen zur KDA/AttnRes-Architektur; staatliche Medien berichten über das «größte Open-Weight-Modell weltweit».

03

22.–23. Juli: US-China-«Destillations»-Streit eskaliert. White-House-Berater Michael Kratsios wirft Moonshot «industrielle Destillation» von Anthropics Fable-Modell vor; Finanzminister Scott Bessent kündigt Sanktionsprüfung an.

04

27. Juli, 23:00 Uhr: Moonshot veröffentlicht vollständige K3-Gewichte, Technikbericht und open-sourct MoonEP sowie AgentEnv (FlashKDA war bereits freigegeben).

05

28. Juli: Chinesisches Handelsministerium reagiert auf US-KI-Sanktionsdrohungen; internationale Medien berichten über Lizenzdetails und Benchmarks.

Drei Tage später kündigte Alibaba (Investor von Moonshot) Qwen3.8-Max-Preview mit 24 Billionen Parametern an — als direkte Antwort auf K3 interpretiert. Die chinesische Frontier-KI-Konkurrenz tritt in die «3T-Klasse» ein.

02

Kernparameter und Benchmarks: K3 vs. GPT-5.6 und Claude

Benchmark-Zahlen variieren je nach Framework und Reproduktion. Nachfolgend bevorzugt unabhängige Drittquellen; Herstellerangaben sind separat gekennzeichnet.

ParameterKimi K3Anmerkung
Gesamtparameter2,8 Billionen (2,8T)Erstes vollständig freigegebenes 3T-Modell
Aktivierte Parameterca. 104 Mrd.MoE-Sparse-Aktivierung
Expertenkonfiguration896 Routing-Experten, 16 pro TokenSparsity ca. 1,8 %
Kontextfenster1.000.000 TokenKDA + Gated MLA Hybrid-Attention
Gewichtsvolumenca. 1,56 TBMXFP4-Gewichte + MXFP8-Aktivierung
LizenzCustom Open WeightOffiziell «open weight», nicht «open source»

SWE-bench Verified (unabhängige Reproduktion, Vals AI, Stand Juli 2026)

ModellScoreRelease
Claude Opus 597 %2026-07-24
GPT-5.6 Sol96,2 %2026-07-09
Claude Fable 595 %2026-06-09
Kimi K393,4 %2026-07-16
Qwen3.7-Max79,4 %2026-05-19
DeepSeek-V476,2 %2026-04-23

Kimi K3 ist die leistungsstärkste Option unter Open Weights — nicht die kostengünstigste. Artificial Analysis Intelligence Index: global Rang 3, Open Weights Rang 1; Kosten pro Aufgabe ca. $0,95 vs. GLM-5.2 ca. $0,47.

03

KDA, AttnRes, Per-Head Muon und drei Open-Infra-Projekte

Kimi K3 überarbeitet drei etablierte Deep-Learning-Komponenten — Attention, Residualverbindungen und Optimizer. Das unterscheidet K3 von reinem Parameterskalieren.

Kimi Delta Attention (KDA) ersetzt das skalare Vergessungstor des Gated DeltaNet durch kanalweise Decay-Raten: Jede Feature-Dimension erhält eine eigene Abklingrate, implementiert als chunkweises DPLR-Rekursionsverfahren in linearer Zeit. K3 wechselt KDA mit wenigen globalen Gated-MLA-Schichten ab — 1M-Token-Kontext bei minimalem KV-Cache-Overhead.

Attention Residuals (AttnRes) ersetzen statische Residualverbindungen durch selektive, eingabeabhängige Aggregation aller vorherigen Layer-Ausgaben. Pro Layer: ein RMSNorm und ein Pseudo-Query-Vektor — ca. 25 % Trainingseffizienzgewinn bei unter 2 % Overhead.

Per-Head Muon lässt jeden Attention-Head unabhängig konvergieren. Zusammen mit Stable LatentMoE (896-zu-16-Sparse-Routing + Quantile Balancing) beweist Moonshot eine theoretische Obergrenze redundanter Experten pro Rechenknoten.

TechnologieFunktionKernfähigkeit
MoonEPFeingranulare MoE-Kommunikation auf Supernode-SkalaTemporäre Replikation überlasteter Experten; gleichmäßige Token-Verteilung pro Knoten; theoretische Obergrenze redundanter Experten
FlashKDACUTLASS-basierter KDA-HochleistungsoperatorH20-Prefill 1,72–2,22× schneller; chunk_kda-Backend-Drop-in
AgentEnvFirecracker-microVM-Agenten-SandboxCheckpoint-Latenz 133 ms, Recovery 49 ms, Memory-Overcommit bis 6,5× (Herstellerangaben, noch nicht unabhängig verifiziert)
Python · OpenAI SDK kompatibel
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)

Hinweis: Moonshot liefert nicht nur Gewichte, sondern auch die drei Infrastrukturprojekte, die K3s Trainingseffizienz und Stabilität ermöglichen — ein zentraler Grund für die positive Entwickler-Community-Reaktion.

04

Kimi K3 Anbindung und Deployment: Sechs-Schritte-Runbook

01

Pfad festlegen: API-Aufruf, OpenRouter-Drittanbieter oder Self-Hosting auf 64+-GPU-Supernode evaluieren. Für Einzelentwickler und KMU ist API oder OpenRouter der realistische Weg.

02

Moonshot API registrieren: API-Key unter https://api.moonshot.ai/v1 anlegen. Modell-ID: kimi-k3. OpenAI-SDK-kompatibel — bestehende Projekte benötigen nur neuen Base-URL und Key.

03

Cache-Strategie konfigurieren: Mooncake-Disaggregated-Inference erreicht bei Coding-Workloads über 90 % Cache-Treffer — effektive Input-Kosten näher $0,30/M statt $3,00/M.

04

Self-Hosting prüfen (optional): Gewichte von Hugging Face moonshotai/Kimi-K3 laden (ca. 1,56 TB). Supernode mit 64+ Beschleunigerkarten, Expert-Parallel und Tensor-Parallel vorbereiten.

05

Lizenz prüfen: MaaS-Jahresumsatz über $20 Mio. oder MAU über 100 Mio. / Monatsumsatz über $20 Mio.? Zusätzliche Lizenzbedingungen beachten.

06

Infra-Toolchain integrieren: Für KDA-Operatoren flash-linear-attention-Backend auf FlashKDA chunk_kda umstellen. Agent-RL-Training: AgentEnv-Sandbox evaluieren.

05

Lizenzschwellen und API-Preisdaten

A

Open Weight vs. Open Source: Moonshot verwendet durchgängig «open weight», nie «open source». Nach OSI-Definition sind Gewichte, Technikbericht und Inferenz-Infra öffentlich; Trainingsdaten und vollständiger Trainingscode fehlen.

B

MaaS-Umsatzschwelle $20 Mio.: Betreibt ihr Model-as-a-Service mit über $20 Mio. kumuliertem Umsatz in 12 Monaten, ist eine separate kommerzielle Vereinbarung mit Moonshot erforderlich.

C

API-Preise (pro 1M Token): Input Cache-Hit $0,30, Cache-Miss $3,00, Output (inkl. Reasoning) $15,00. Artificial Analysis: ca. $0,95/Aufgabe — ca. 60 % günstiger als Claude Fable 5 (ca. $2,40/Aufgabe).

Achtung: 2,8 Billionen Parameter und 896 Experten machen Consumer-Hardware-Deployment unrealistisch. OpenRouter listet K3 bereits bei sieben Anbietern — Preise meist identisch mit Moonshot-API. Bei DSGVO-relevanten Produktionsdaten: Datenverarbeitung in Drittländern und fehlende EU-Region vor Go-Live prüfen.

Wer Agent-Orchestrierung, CI/CD-Pipelines oder dauerhafte Gateway-Prozesse lokal auf dem Mac betreibt, stößt bei K3-Self-Hosting an Hardwaregrenzen; lokale Macs unterbrechen lange Agent-Loops durch Ruhezustand und Speicherengpässe. Für 7×24 iOS-CI/CD und Agent-Automatisierung ist MESHLAUNCH Mac Mini Cloud Bare-Metal die stabilere Basis: dediziertes Apple Silicon, flexible Tages-/Wochen-/Monats-Tarife — Inferenz über API, Orchestrierung und Builds auf stabilen Cloud-Mac-Knoten mit Metal-Grafik-API-Fidelity. Mietpreise und Hilfezentrum.

FAQ

Nein im OSI-Sinne. Kimi K3 ist ein «Open-Weight»-Modell: fertige Gewichte, Technikbericht und Teile der Infra sind öffentlich; Trainingsdaten und vollständiger Trainingscode fehlen. Hintergrund: Kimi K3 Test 2026.

Ja, in den meisten Fällen ohne Einschränkung. Ausnahme: MaaS-Anbieter mit über $20 Mio. Jahresumsatz oder Produkte mit über 100 Mio. MAU bzw. $20 Mio. Monatsumsatz. Cloud-Entwicklungsumgebung: Mietpreise.

Moonshot empfiehlt mindestens 64 Beschleunigerkarten auf einem Supernode. Für die meisten Teams: API oder OpenRouter. Repository-Setup und Cloud-Mac-Konfiguration: Hilfezentrum.

SWE-bench Verified: 93,4 %. Artificial Analysis Intelligence Index: global Rang 3, Open Weights Rang 1 — hinter Claude Fable 5 und GPT-5.6 Sol, teurer als GLM-5.2. Destillationskontext: Claude Opus 5 vs. Kimi K3.

K3 hat etwa dreifache Parameterzahl gegenüber K2.5, neue Attention Residuals und Per-Head Muon, 1M-Token-Kontext und native Vision. Erstmals $20M-MaaS-Umsatzschwelle in der Lizenz. Release-Details: Open Weights Release 27.7.