Kimi K3: Kernspezifikationen des 2,8-Billionen-Parameter-Modells
Am 16. Juli 2026 veröffentlichte Moonshot AI Kimi K3 — ein sparsames Mixture-of-Experts-Modell (MoE) mit 2,8 Billionen (2,8T) Parametern. Das übertrifft den bisherigen Rekordhalter DeepSeek V4 Pro (1,6T) um knapp 75 %, ist 2,7× größer als Xiaomis Open-Source-Modell (1,02T) und mehr als 7× größer als Alibabas 397B. Stille Veröffentlichung, massive Skala: ein Tech-Blog, eine Preisseite, sofort aufrufbare Modell-ID kimi-k3.
K3 nutzt 896 Experten, aktiviert 16 pro Inferenzschritt (Sparsity 1,8 %); dazu 1.048.576 Token Kontext (1M) und native Bild-/Video-Verständnis — ausgelegt auf komplexes Coding, Langdokument-Reasoning und Wissensarbeit. Kurzfassung: Open Source, multimodal, extrem langer Kontext, 40 % günstiger als Claude Opus 4.8 bei vergleichbaren Benchmarks; vollständige Gewichte ab 27. Juli 2026 als Download.
Skalenschock: Nach DeepSeeks Aufstieg schrumpfte Moonshots Marktanteil stark — K3 ist die strategische Gegenoffensive. In 9 von 12 Monaten führte die Kimi-Serie die Open-Source-Größenklasse an.
Timing: Veröffentlichung kurz vor der WAIC 2026 (17.–20. Juli); weitere Ankündigungen erwartet.
Commercialisierung: ARR über $300 Mio. (Stand Juni 2026), 6. Finanzierungsrunde in diesem Jahr, Pre-Money-Bewertung $31,5 Mrd.; API-Umsatzanteil über 70 %, internationale zahlende Nutzer +400 %.
Long-Context-Problem: Vollständige Attention bei 1M Token erzeugt exponentielles KV-Cache-Wachstum — KDA adressiert genau diesen Engpass.
Coding-Agent-Bedarf: SWE Marathon testet stundenlange Code-Sessions; 1M-Fenster plus 90 %+ Cache-Trefferquote sind zentrale Verkaufsargumente.
| Parameter | Wert |
|---|---|
| Gesamtparameter | 2,8 Billionen (größtes Open-Source-Modell weltweit) |
| Architektur | KDA + AttnRes + Stable LatentMoE |
| Aktive Experten | 16 / 896 (sparse MoE, 1,8 %) |
| Kontextfenster | 1.048.576 Tokens (1M) |
| Input-Modalitäten | Text, Bild, Video |
| Inferenzmodus | Always-on Max Effort (low/high folgen) |
| Open Weights | 27. Juli 2026 auf Hugging Face |
Architektur und Benchmarks: KDA, AttnRes und Stable LatentMoE
Kimi Delta Attention (KDA) kombiniert lineare und vollständige Attention im Verhältnis 3:1 — drei lineare Schichten für lokale Struktur (günstig), eine Vollattention-Schicht für globalen Informationsfluss. Ergebnis: KV-Cache-Speicher bis −75 %, Decoding-Geschwindigkeit bei 1M Token bis 6,3× schneller; übertrifft reine Vollattention bei kurzen und langen Kontexten sowie RL-Skalierung.
Attention Residuals (AttnRes) überarbeiten Residual-Verbindungen in der Tiefe: Standard-Residuen verwässern frühe Schlüsselrepräsentationen; AttnRes ermöglicht selektives Abrufen hochwertiger früher Layer — ca. 25 % Trainings-Effizienzgewinn bei unter 2 % Extra-Compute.
Stable LatentMoE stabilisiert Training bei 896 Experten / 16 Aktivierungen. Begleittechnologien:
| Technologie | Funktion |
|---|---|
| Quantile Balancing | Expertenzuweisung direkt aus Router-Score-Quantilen — ohne heuristische Hyperparameter |
| Per-Head Muon | Optimierung pro Attention-Head für adaptives Large-Scale-Training |
| Sigmoid Tanh Unit (SiTU) | Verbesserte Aktivierungsfunktion |
| Gated MLA | Höhere Attention-Selektivität |
Gesamte Skalierungseffizienz gegenüber Kimi K2: ca. 2,5×. Moonshots selbst gemeldete Benchmarks (jeweils eigener Inferenz-Harness pro Modell; unabhängige Reproduktion läuft):
| Benchmark | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GLM-5.2 |
|---|---|---|---|---|---|
| DeepSWE | 67,5 | 70,0 | 73,0 | 59,0 | 46,2 |
| Program Bench | 77,8 | 76,8 | 77,6 | 71,9 | 63,7 |
| Terminal Bench 2.1 | 88,3 | 84,6 | 88,8 | 84,6 | 82,7 |
| FrontierSWE | 81,2 | 86,6 | 71,3 | 66,7 | 67,3 |
| SWE Marathon | 42,0 | 35,0 | 39,0 | 40,0 | 13,0 |
| BrowseComp | 91,2 | 88,0 | 90,4 | 84,3 | — |
| Automation Bench | 30,8 | 29,1 | 29,7 | 27,2 | 12,9 |
| GPQA-Diamond | 93,5 | 92,6 | 94,1 | 91,0 | 91,2 |
| MMMU-Pro (Vision) | 81,6 | 81,2 | 83,0 | 78,9 | — |
| OmniDocBench | 91,1 | 89,8 | 85,8 | 87,9 | — |
SWE Marathon misst anhaltende Langzeit-Coding-Arbeit — K3 führt mit 42,0 deutlich. Im Artificial Analysis Intelligence Index v4.1 erreicht K3 57,1 Punkte (Rang 4), hinter Claude Fable 5 (59,9) und GPT-5.6 Sol (58,9) — Abstand nur 2,8 Punkte; höchster Open-Source-Wert in diesem Index.
Preise: Kimi K3 vs Claude, GPT und DeepSeek
K3-Standardpreis entspricht Claude Sonnet 5 ($3/$15 pro 1M Tokens), bietet aber 5× größeres Kontextfenster (1M vs 200K). Cache-Treffer: $0,30/M Input (1/10 des Standardpreises); Moonshot meldet über 90 % Cache-Trefferquote in Coding-Szenarien — effektive Input-Kosten minimal. OpenRouter-7-Tage-Durchschnitt: ca. $0,55/M effektiver Input.
| Modell | Input ($/M) | Output ($/M) | Cache-Input | Kontext |
|---|---|---|---|---|
| Kimi K3 | $3,00 | $15,00 | $0,30 | 1M |
| Claude Sonnet 5 | $3,00 (Promo $2) | $15,00 (Promo $10) | — | 200K |
| Claude Opus 4.8 | $5,00 | $25,00 | — | 200K |
| GPT-5.5 | $5,00 | $30,00 | — | 400K |
| DeepSeek V4 Pro | $1,74 | $3,48 | $0,145 | 128K |
| Kimi K2.6 | $0,95 | $4,00 | $0,16 | 256K |
Gegenüber Claude Opus 4.8: K3 übertrifft mehrere Benchmarks bei nur 60 % Input- und 40 % Output-Kosten. China-API: ¥20/M Input, ¥100/M Output, ¥2/M Cache. Consumer-Zugang auf Kimi.com kostenlos; Prepaid ab ¥199 (Aktion bis 11. August).
Sofort starten: vier Zugangswege und Sechs-Schritte-Runbook
Kimi Web/App: kimi.com — Konto anlegen (Google-Login möglich), K3 läuft standardmäßig im Max-Modus, keine Kreditkarte nötig.
API-Key: Entwicklerkonto auf platform.kimi.ai, Key erstellen und Guthaben aufladen.
OpenAI-kompatibler Client: base_url="https://api.moonshot.ai/v1", Modell-ID kimi-k3.
OpenRouter: Modell-ID moonshotai/kimi-k3, offizielle Moonshot-Preise ohne Aufschlag, volles 1M-Kontextfenster.
Prompt Caching aktivieren: Conversation-Cache-Key in Coding-Workflows setzen — 90 %+ Trefferquote senkt effektiven Input auf ca. $0,55/M.
27. Juli markieren: Vollständige Gewichte auf Hugging Face; MXFP4/NVFP4-Quantisierung plus vLLM/SGLang Day-0-Support erwartet. Produktion: Supernode mit 64+ Beschleunigerkarten. Bei personenbezogenen Code- oder Kundendaten in der Cloud: DSGVO-konforme Verarbeitung, Auftragsverarbeitungsvertrag und Datenresidenz vor Produktionsstart prüfen.
from openai import OpenAI
client = OpenAI(
api_key="your_moonshot_api_key",
base_url="https://api.moonshot.ai/v1"
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Analysiere diesen Code..."}]
)
Open-Source-Zeitplan: WAIC 17.–20. Juli weitere Ankündigungen → 27. Juli vollständige K3-Gewichte — erstes herunterladbares Open-Source-Modell über 2 Billionen Parameter.
Entscheidungsmatrix: Szenarien und zitierbare Kennzahlen
| Szenario | Empfehlung | Begründung |
|---|---|---|
| Anhaltende Langzeit-Coding-Tasks | Kimi K3 | SWE Marathon Rang 1, längstes 1M-Kontextfenster |
| Komplexe Repo-Level-Bugfixes | Claude Fable 5 | FrontierSWE 86,6 deutlich vorn |
| Terminal-/Toolchain-intensive Agenten | GPT-5.6 Sol | Terminal Bench 2.1 und Coding Agent Index führend |
| Ultra-Langdokumente / Multimodal | Kimi K3 | OmniDocBench 91,1, native Vision + 1M Kontext |
| Kostenkritische Workloads | DeepSeek V4 Pro | Output nur $3,48/M — weit unter K3 |
| Open-Source-Self-Hosting (ab 27.7.) | Kimi K3 | Stärkste Open Weights, MXFP4-quantisfreundlich |
Parametergröße: 2,8T — +75 % gegenüber DeepSeek V4 Pro (1,6T); größtes herunterladbares Open-Source-Modell ab 27.7.
KDA-Effizienz: KV-Cache −75 %, 1M-Token-Decoding +6,3×, Skalierungseffizienz +2,5× vs K2.
Intelligence Index: Artificial Analysis v4.1: 57,1 Punkte — höchster Open-Source-Wert, 2,8 Punkte hinter Closed-Source-Flaggschiffen.
Hinweis: Benchmarks sind Moonshot-eigene Messungen (K3 via Kimi Code, GPT via Codex, Claude via Claude Code). Unabhängige Reproduktion läuft — Werte als Richtung, nicht als finale Wahrheit behandeln. Bei DSGVO-relevanten Produktionsdaten: API-Verarbeitung in Drittländern und fehlende EU-Region vor Go-Live klären.
Kimi K3 ist kein reines Parameter-Showcase — KDA, AttnRes und Stable LatentMoE sind messbare Engineering-Innovationen, die in Coding-Langaufgaben und Dokumentverständnis Closed-Source-Flaggschiffe erreichen oder übertreffen. Reiner API-Zugang reicht für schnelle Tests; lokale Macs kollabieren unter langen Kimi-Code-Agent-Loops (Swap, IDE-Overhead); VMs verlieren Metal/Xcode-Fidelity. Für 7×24 Coding-Agenten, parallele Dev-Server und dauerhafte Inferenz ist MESHLAUNCH Mac Mini Cloud Bare-Metal die stabilere Produktionsbasis: dediziertes Apple Silicon, flexible Tages-/Wochen-/Monats-Tarife — ideal für iOS-CI/CD und Agent-Automatisierung. Mietpreise und Hilfezentrum.
Quellen: Moonshot AI Blog · Kimi API Platform · Artificial Analysis · OpenRouter · VentureBeat · SCMP
Ja — kostenloses Konto auf kimi.com, K3 im Max-Modus. API: $3/$15 pro 1M Tokens. Budget planen: Mietpreise.
Vollständige Gewichte ab 27.7.2026 auf Hugging Face. Produktion: 64+ Beschleunigerkarten Supernode; Consumer-Deployment unrealistisch. Training: MXFP4-Gewichte + MXFP8-Aktivierung, quantisierungsfreundlich.
K3: fast doppelte Parameter, 8× Kontext, stärkere Coding-/Dokument-Benchmarks. DeepSeek V4 Pro: Output $3,48/M — besser bei knappem Budget. Details: Hilfezentrum.
Ja für vollständige Codebase-Analyse, lange Rechts-/Forschungsdokumente und Agent-Langzeitgedächtnis. Flat-Pricing ohne Längenzuschlag; 90 %+ Cache-Treffer halten Kosten niedrig.
Moonshot kündigt low- und high-Modi für spätere Updates an. Derzeit nur Max-Modus verfügbar.