Kimi K3 Open Weights
Release 27.7., Benchmarks & Self-Hosting

16.7. API · 27.7. Modified MIT · 2,8T · Index 57,1 · 0,94 $/Aufgabe · 1,4 TB Realität · DSGVO

Kimi K3 Open Weights Release 27. Juli 2026 Benchmark-Vergleich
Moonshot AI veröffentlicht am 27. Juli 2026 die vollständigen Gewichte von Kimi K3 — einem 2,8-Billionen-Parameter-MoE-Modell mit 1M-Token-Kontext (1.048.576) — unter Modified MIT. Die API ist seit dem 16. Juli live. Wer auf den größten Open-Weight-Drop wartet, K3 gegen Claude Fable 5 und GPT-5.6 Sol vergleicht oder Self-Hosting vs API unter DSGVO-Datensouveränität bewertet, findet hier: ① Meilenstein-Split 16.7. vs 27.7.; ② AA Intelligence Index 57,1 mit vollständigen Tabellen; ③ API-Kosten inkl. Cache (0,94 $/Aufgabe, 65,8 % unter Fable 5); ④ warum 1,4 TB bei 4-Bit nicht auf dem Laptop läuft.
01

Kimi K3 Release: API-Launch vs Open-Weights-Drop

Am 16. Juli 2026 lieferte Moonshot Kimi K3 über Kimi App, Kimi Work, Kimi Code und API aus. Artificial Analysis veröffentlichte am selben Tag eine unabhängige Bewertung. Am 27. Juli gehen vollständige Modellgewichte (Modified MIT) plus technischer Report (Architektur, Training, Evaluation) auf Hugging Face online.

Kernbefund: K3 ist kein Fable-5-Killer. AA Intelligence Index 57,1, Rang #3 von 189, hinter Claude Fable 5 (59,9) und GPT-5.6 Sol (58,9). Es liefert nahe-Frontier-Fähigkeit bei etwa einem Drittel der Kosten plus zwei Dinge, die geschlossene Modelle nicht bieten: herunterladbare Open Weights und 1M-Token-Kontext.

DatumEreignis
2026-07-16K3-API und Kimi-Produktsuite; Artificial-Analysis-Benchmark
2026-07-17WAIC-Eröffnung Shanghai; Staatsmedien rahmen K3 als nationalen KI-Meilenstein
2026-07-27Vollständige Gewichte auf Hugging Face (Modified MIT) + technischer Report
01

API jetzt nutzbar: Modell-ID kimi-k3 auf platform.kimi.ai — kein Warten auf Gewichte nötig.

02

Gewichte ≠ sofort lokal: vLLM-Support für KDA und Prefix-Caching kommt mit dem Weight-Release; Ollama- und GGUF-Ports folgen K2-Muster.

03

Ungewöhnlich ehrlicher Vendor: Moonshot räumt Rückstand zu Fable 5 und Sol ein — Harness-Sensitivität und übereifrige Antworten bei vagen Prompts.

04

Regulatorischer Kontext: Release-Timing passt zur WAIC. US-Regulatoren zogen Anthropic Fable/Mythos im Juni kurz zurück (Wiederherstellung 1.7.) — Narrativ: API-Sperren treffen geschlossene Modelle, nicht veröffentlichte Gewichte.

05

Moonshot-Comeback: Nach DeepSeek R1 (Marktanteil Anfang 2025 auf #7) baute die K2 → K2.5 → K3 Open-Weight-Roadmap Vertrauen wieder auf.

02

Was ist Kimi K3? Specs auf einen Blick

K3 nutzt Stable LatentMoE: 896 Experten, 16 pro Token aktiv (~1,8 % Sparsity). Attention-Stack: Kimi Delta Attention (KDA, hybride lineare Attention) + Attention Residuals (AttnRes) + Gated MLA. Gewichte als MXFP4, Aktivierungen MXFP8 (Low-Precision-Training). Skalierungseffizienz ~2,5× besser als K2; KDA liefert bis zu 6,3× Decode-Speedup bei 1M Kontext.

SpecWert
Gesamtparameter2,8 Billionen — größtes Open-Weight-Modell bisher
ArchitekturSparse MoE: Stable LatentMoE, 896 Experten / 16 aktiv pro Token
AttentionKDA + AttnRes + Gated MLA
Kontextfenster1.048.576 Tokens (1M)
ModalitätenNative Vision (Text + Bild; Video im Produkt), Text-Output
GewichtsformatMXFP4-Gewichte + MXFP8-Aktivierungen
Training-StabilitätQuantile Balancing, Per-Head Muon Optimizer, SiTU-Aktivierung
Lizenz (27.7.)Modified MIT — LICENSE am Release-Tag prüfen

In Headlines Open Weights schreiben, nicht Open Source. Die Unterscheidung zählt — und trifft die High-Intent-Suche „kimi k3 open weights". Für EU-Unternehmen mit DSGVO Art. 44 ff. ist Self-Hosting der einzige Weg, Prompts und Outputs garantiert in der EU zu halten — sofern die Infrastruktur dort steht.

03

Kimi K3 Benchmarks: Vergleich mit Claude Fable 5 und GPT-5.6

Daten aus Artificial Analysis (16.7.) und Moonshot-Materialien, querverifiziert. Benchmarks laufen über unterschiedliche Harnesses — Quelle und Datum immer mitangeben.

ModellAA Intelligence IndexRang
Claude Fable 559,9#1
GPT-5.6 Sol58,9#2
Kimi K357,1#3 / 189

Wo K3 gewinnt oder gleichzieht:

Frontend Code Arena: #1 — blinde Dev-Präferenz für UI-Code vor Fable und Sol

Automation Bench, SpreadsheetBench 2: #1

BrowseComp: 91,2 (#1) — 90,4+ mit 1M-Kontext ohne Kompression

SWE Marathon: 42,0 — weit voraus (GPT-5.5 / GLM-5.2 im niedrigen Zehnerbereich)

Terminal Bench 2.1: 88,3 — nahe Sol (88,8)

Program Bench: 77,8 — knapp vor Sol (77,6)

FrontierSWE: 81,2 — schlägt Sol (71,3), hinter Fable 5 (86,6)

Wo K3 noch hinterherhinkt:

GDPval v2 Elo: 1668–1687 vs Fable 5 (1760), Sol (1748) — Langstrecken-Urteil bleibt Fable-Territorium

DeepSWE: 67,5 vs Sol 73,0

Halluzinationsrate vs K2.6 gestiegen (vom Vendor bestätigt); Reddit berichtet mehr Halluzinationen als Top-Closed-Modelle bei Self-Hosting

Gesprächspolish und Session-Varianz unter Fable 5 / Sol

DimensionKimi K3Claude Fable 5GPT-5.6 Sol
Intelligence Index57,1 (#3)59,9 (#1)58,9 (#2)
Kosten pro Aufgabe (AA)0,94 $~2,75 $~1,04 $
vs Fable 565,8 % günstiger; 9,4 % unter Sol
Open Weights27.7.GeschlossenGeschlossen
Kontext1M Tokens~200K-Klasse128K–1M je Tier
04

Kimi K3 API-Preise und Release-Checkliste 27.7.

Preise auf Western-Quality-Tier-Niveau — höchste unter chinesischen Anbietern, dennoch deutlich unter Claude Opus 4.8 pro Aufgabe. Coding-Workloads melden 90 %+ Cache-Treffer, was effektive Kosten senkt. DSGVO-Hinweis: API-Nutzung über platform.kimi.ai kann personenbezogene Daten Drittstaaten überlassen — Auftragsverarbeitungsvertrag und Transfer-Impact-Assessment vor Produktionseinsatz prüfen.

PostenPreis (pro 1M Tokens)
Input (Cache-Miss)3,00 $
Input (Cache-Treffer, automatisch)0,30 $
Output15,00 $

Was am 27. Juli passiert — Sechs-Schritte-Checkliste:

01

Vollständige 2,8T-Gewichte auf Moonshot Hugging Face unter Modified MIT (Bedingungen TBC)

02

Technischer Report — Architektur, Training, Evaluationsdetails

03

vLLM-Ökosystem — KDA + Prefix-Caching mit Gewichten

04

Community-Follow-ons — Ollama, GGUF-Quants wie K2-Serie erwartet

05

LICENSE-Text prüfen — kommerzieller Weitervertrieb am Release-Tag

06

Unabhängiger Langkontext-Retest — Community-Benchmarks gegen offizielle Zahlen

Quellen: kimi.com/en/blog/kimi-k3, platform.kimi.ai, Artificial Analysis (16.7.), VentureBeat, Northflank Self-Hosting-Analyse, r/LocalLLaMA, Hacker News.

05

Kimi K3 lokal betreiben? Hardware und Branchenwirkung

Nicht auf Consumer-Hardware. 4-Bit-Gewichte ca. 1,4 TB. Moonshot empfiehlt Super-Node mit 64+ Beschleunigern, Expert-Parallelismus plus Tensor-Parallelismus. Referenz: K2.7 Code (1T Parameter) brauchte ~577 GB VRAM bei INT4; K3 ist 2,8× dieser Skala.

Für die meisten Teams: API (3 $/15 $). Self-Hosting lohnt bei strikter Datensouveränität (DSGVO Art. 32), Fine-Tuning auf proprietären Daten oder Volumen, wo eigene Hardware Cloud-Rechnungen schlägt — vorausgesetzt Rechenzentrum und Betrieb liegen in der EU.

A

2,8T Parameter, 896 Experten / 16 aktiv, 1M Kontext — Referenzzeile eins

B

~1,4 TB bei 4-Bit; 64+ Beschleuniger empfohlen — jede „auf dem Laptop"-Headline ist Clickbait

C

Frontend Code Arena #1; SWE Marathon 42,0 — Coding-Vorsprung bei Langsessions

Branchenwirkung — vier Datenpunkte:

1

Open-vs-Closed-Lücke fast geschlossen — von Prozentpunkten zu 2–3 Index-Punkten; Closed-Premium allein schwerer zu rechtfertigen

2

Regulatorisches Narrativ — veröffentlichte Gewichte überleben API-Sperren

3

Chinesische Anbieterwelle — GLM-5.2, DeepSeek V4 Pro, MiniMax; K3 ist der Parameter-Peak

4

Moonshot-Strategie-Reset — Open-Weight-Kadenz nach DeepSeek-R1-Disruption

Ein 64-GPU-Inferenz-Cluster hat versteckte Ops-Kosten — Strom, Netzwerk, Version-Pinning, On-Call. Wer stabile Mac-Hosts für iOS-CI/CD und KI-Agent-Orchestrierung braucht und K3 per API aufruft, ist mit MESHLAUNCH Cloud-Mac-Mini-Miete meist auf dem besseren Produktionspfad: dediziertes Apple Silicon, 7×24 online, flexible Tages-/Wochen-/Monatsmiete. Kapazität: Mietpreise; Ersthelfer: Hilfezentrum.

FAQ

27. Juli 2026 auf Moonshot Hugging Face. API seit 16. Juli live — zwei verschiedene Meilensteine (Download vs Aufruf).

27.7. liefert Open Weights, nicht vollständig Open Source (kein Trainingscode/Daten). Modified-MIT-Bedingungen am Release-Tag lesen. Architektur-Tiefe: Kimi-K3-Test.

3 $/M Input, 0,30 $/M gecacht, 15 $/M Output. ~0,94 $ pro Aufgabe in AA-Tests. Agent-Dev-Umgebungen: Mietpreise.

Nein. ~1,4 TB bei 4-Bit braucht Rechenzentrum-GPU-Cluster. Auf destillierte GGUF-Builds warten — mit erheblichen Capability-Trade-offs. Self-Hosting in der EU: DSGVO-konforme Infrastruktur vorab planen.

Gesamtindex: nein (#3). Coding- und Automation-Benches: oft ja. Langstrecken-Reasoning und Stabilität: Fable/Sol-Territorium. Moonshot sagt das öffentlich. Hybrid-Setup: Hilfezentrum.