Kimi K3 Test 2026
2,8 Billionen Parameter — Open-Source-Rekord

KDA-Architektur · 1M-Token-Kontext · Benchmark-Tabellen · Preisvergleich · API-Anbindung · Open Weights 27.7.

Kimi K3 2,8 Billionen Parameter Open-Source-Modell Test 2026
In der Nacht vom 16. Juli 2026 setzte Moonshot AI (月之暗面) in der API-Dokumentation «Kimi K3 ist live» — ohne Pressekonferenz, aber mit dem derzeit größten Open-Source-KI-Modell weltweit (2,8 Billionen Parameter). Wer Coding-Agenten evaluiert, Claude Fable 5 und GPT-5.6 Sol vergleicht oder auf Open Weights wartet, erhält hier drei Antworten: ① Was KDA, AttnRes und Stable LatentMoE technisch lösen; ② Wie K3 bei SWE Marathon, OmniDocBench und weiteren Benchmarks abschneidet; ③ $3/$15-Preise, vier Anbindungswege und was der Open-Weight-Release am 27. Juli bedeutet. Datenstand: 17. Juli 2026.
01

Kimi K3: Kernspezifikationen des 2,8-Billionen-Parameter-Modells

Am 16. Juli 2026 veröffentlichte Moonshot AI Kimi K3 — ein sparsames Mixture-of-Experts-Modell (MoE) mit 2,8 Billionen (2,8T) Parametern. Das übertrifft den bisherigen Rekordhalter DeepSeek V4 Pro (1,6T) um knapp 75 %, ist 2,7× größer als Xiaomis Open-Source-Modell (1,02T) und mehr als 7× größer als Alibabas 397B. Stille Veröffentlichung, massive Skala: ein Tech-Blog, eine Preisseite, sofort aufrufbare Modell-ID kimi-k3.

K3 nutzt 896 Experten, aktiviert 16 pro Inferenzschritt (Sparsity 1,8 %); dazu 1.048.576 Token Kontext (1M) und native Bild-/Video-Verständnis — ausgelegt auf komplexes Coding, Langdokument-Reasoning und Wissensarbeit. Kurzfassung: Open Source, multimodal, extrem langer Kontext, 40 % günstiger als Claude Opus 4.8 bei vergleichbaren Benchmarks; vollständige Gewichte ab 27. Juli 2026 als Download.

01

Skalenschock: Nach DeepSeeks Aufstieg schrumpfte Moonshots Marktanteil stark — K3 ist die strategische Gegenoffensive. In 9 von 12 Monaten führte die Kimi-Serie die Open-Source-Größenklasse an.

02

Timing: Veröffentlichung kurz vor der WAIC 2026 (17.–20. Juli); weitere Ankündigungen erwartet.

03

Commercialisierung: ARR über $300 Mio. (Stand Juni 2026), 6. Finanzierungsrunde in diesem Jahr, Pre-Money-Bewertung $31,5 Mrd.; API-Umsatzanteil über 70 %, internationale zahlende Nutzer +400 %.

04

Long-Context-Problem: Vollständige Attention bei 1M Token erzeugt exponentielles KV-Cache-Wachstum — KDA adressiert genau diesen Engpass.

05

Coding-Agent-Bedarf: SWE Marathon testet stundenlange Code-Sessions; 1M-Fenster plus 90 %+ Cache-Trefferquote sind zentrale Verkaufsargumente.

ParameterWert
Gesamtparameter2,8 Billionen (größtes Open-Source-Modell weltweit)
ArchitekturKDA + AttnRes + Stable LatentMoE
Aktive Experten16 / 896 (sparse MoE, 1,8 %)
Kontextfenster1.048.576 Tokens (1M)
Input-ModalitätenText, Bild, Video
InferenzmodusAlways-on Max Effort (low/high folgen)
Open Weights27. Juli 2026 auf Hugging Face
02

Architektur und Benchmarks: KDA, AttnRes und Stable LatentMoE

Kimi Delta Attention (KDA) kombiniert lineare und vollständige Attention im Verhältnis 3:1 — drei lineare Schichten für lokale Struktur (günstig), eine Vollattention-Schicht für globalen Informationsfluss. Ergebnis: KV-Cache-Speicher bis −75 %, Decoding-Geschwindigkeit bei 1M Token bis 6,3× schneller; übertrifft reine Vollattention bei kurzen und langen Kontexten sowie RL-Skalierung.

Attention Residuals (AttnRes) überarbeiten Residual-Verbindungen in der Tiefe: Standard-Residuen verwässern frühe Schlüsselrepräsentationen; AttnRes ermöglicht selektives Abrufen hochwertiger früher Layer — ca. 25 % Trainings-Effizienzgewinn bei unter 2 % Extra-Compute.

Stable LatentMoE stabilisiert Training bei 896 Experten / 16 Aktivierungen. Begleittechnologien:

TechnologieFunktion
Quantile BalancingExpertenzuweisung direkt aus Router-Score-Quantilen — ohne heuristische Hyperparameter
Per-Head MuonOptimierung pro Attention-Head für adaptives Large-Scale-Training
Sigmoid Tanh Unit (SiTU)Verbesserte Aktivierungsfunktion
Gated MLAHöhere Attention-Selektivität

Gesamte Skalierungseffizienz gegenüber Kimi K2: ca. 2,5×. Moonshots selbst gemeldete Benchmarks (jeweils eigener Inferenz-Harness pro Modell; unabhängige Reproduktion läuft):

BenchmarkKimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GLM-5.2
DeepSWE67,570,073,059,046,2
Program Bench77,876,877,671,963,7
Terminal Bench 2.188,384,688,884,682,7
FrontierSWE81,286,671,366,767,3
SWE Marathon42,035,039,040,013,0
BrowseComp91,288,090,484,3
Automation Bench30,829,129,727,212,9
GPQA-Diamond93,592,694,191,091,2
MMMU-Pro (Vision)81,681,283,078,9
OmniDocBench91,189,885,887,9

SWE Marathon misst anhaltende Langzeit-Coding-Arbeit — K3 führt mit 42,0 deutlich. Im Artificial Analysis Intelligence Index v4.1 erreicht K3 57,1 Punkte (Rang 4), hinter Claude Fable 5 (59,9) und GPT-5.6 Sol (58,9) — Abstand nur 2,8 Punkte; höchster Open-Source-Wert in diesem Index.

03

Preise: Kimi K3 vs Claude, GPT und DeepSeek

K3-Standardpreis entspricht Claude Sonnet 5 ($3/$15 pro 1M Tokens), bietet aber 5× größeres Kontextfenster (1M vs 200K). Cache-Treffer: $0,30/M Input (1/10 des Standardpreises); Moonshot meldet über 90 % Cache-Trefferquote in Coding-Szenarien — effektive Input-Kosten minimal. OpenRouter-7-Tage-Durchschnitt: ca. $0,55/M effektiver Input.

ModellInput ($/M)Output ($/M)Cache-InputKontext
Kimi K3$3,00$15,00$0,301M
Claude Sonnet 5$3,00 (Promo $2)$15,00 (Promo $10)200K
Claude Opus 4.8$5,00$25,00200K
GPT-5.5$5,00$30,00400K
DeepSeek V4 Pro$1,74$3,48$0,145128K
Kimi K2.6$0,95$4,00$0,16256K

Gegenüber Claude Opus 4.8: K3 übertrifft mehrere Benchmarks bei nur 60 % Input- und 40 % Output-Kosten. China-API: ¥20/M Input, ¥100/M Output, ¥2/M Cache. Consumer-Zugang auf Kimi.com kostenlos; Prepaid ab ¥199 (Aktion bis 11. August).

04

Sofort starten: vier Zugangswege und Sechs-Schritte-Runbook

01

Kimi Web/App: kimi.com — Konto anlegen (Google-Login möglich), K3 läuft standardmäßig im Max-Modus, keine Kreditkarte nötig.

02

API-Key: Entwicklerkonto auf platform.kimi.ai, Key erstellen und Guthaben aufladen.

03

OpenAI-kompatibler Client: base_url="https://api.moonshot.ai/v1", Modell-ID kimi-k3.

04

OpenRouter: Modell-ID moonshotai/kimi-k3, offizielle Moonshot-Preise ohne Aufschlag, volles 1M-Kontextfenster.

05

Prompt Caching aktivieren: Conversation-Cache-Key in Coding-Workflows setzen — 90 %+ Trefferquote senkt effektiven Input auf ca. $0,55/M.

06

27. Juli markieren: Vollständige Gewichte auf Hugging Face; MXFP4/NVFP4-Quantisierung plus vLLM/SGLang Day-0-Support erwartet. Produktion: Supernode mit 64+ Beschleunigerkarten. Bei personenbezogenen Code- oder Kundendaten in der Cloud: DSGVO-konforme Verarbeitung, Auftragsverarbeitungsvertrag und Datenresidenz vor Produktionsstart prüfen.

Python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Analysiere diesen Code..."}]
)

Open-Source-Zeitplan: WAIC 17.–20. Juli weitere Ankündigungen → 27. Juli vollständige K3-Gewichte — erstes herunterladbares Open-Source-Modell über 2 Billionen Parameter.

05

Entscheidungsmatrix: Szenarien und zitierbare Kennzahlen

SzenarioEmpfehlungBegründung
Anhaltende Langzeit-Coding-TasksKimi K3SWE Marathon Rang 1, längstes 1M-Kontextfenster
Komplexe Repo-Level-BugfixesClaude Fable 5FrontierSWE 86,6 deutlich vorn
Terminal-/Toolchain-intensive AgentenGPT-5.6 SolTerminal Bench 2.1 und Coding Agent Index führend
Ultra-Langdokumente / MultimodalKimi K3OmniDocBench 91,1, native Vision + 1M Kontext
Kostenkritische WorkloadsDeepSeek V4 ProOutput nur $3,48/M — weit unter K3
Open-Source-Self-Hosting (ab 27.7.)Kimi K3Stärkste Open Weights, MXFP4-quantisfreundlich
A

Parametergröße: 2,8T — +75 % gegenüber DeepSeek V4 Pro (1,6T); größtes herunterladbares Open-Source-Modell ab 27.7.

B

KDA-Effizienz: KV-Cache −75 %, 1M-Token-Decoding +6,3×, Skalierungseffizienz +2,5× vs K2.

C

Intelligence Index: Artificial Analysis v4.1: 57,1 Punkte — höchster Open-Source-Wert, 2,8 Punkte hinter Closed-Source-Flaggschiffen.

Hinweis: Benchmarks sind Moonshot-eigene Messungen (K3 via Kimi Code, GPT via Codex, Claude via Claude Code). Unabhängige Reproduktion läuft — Werte als Richtung, nicht als finale Wahrheit behandeln. Bei DSGVO-relevanten Produktionsdaten: API-Verarbeitung in Drittländern und fehlende EU-Region vor Go-Live klären.

Kimi K3 ist kein reines Parameter-Showcase — KDA, AttnRes und Stable LatentMoE sind messbare Engineering-Innovationen, die in Coding-Langaufgaben und Dokumentverständnis Closed-Source-Flaggschiffe erreichen oder übertreffen. Reiner API-Zugang reicht für schnelle Tests; lokale Macs kollabieren unter langen Kimi-Code-Agent-Loops (Swap, IDE-Overhead); VMs verlieren Metal/Xcode-Fidelity. Für 7×24 Coding-Agenten, parallele Dev-Server und dauerhafte Inferenz ist MESHLAUNCH Mac Mini Cloud Bare-Metal die stabilere Produktionsbasis: dediziertes Apple Silicon, flexible Tages-/Wochen-/Monats-Tarife — ideal für iOS-CI/CD und Agent-Automatisierung. Mietpreise und Hilfezentrum.

Quellen: Moonshot AI Blog · Kimi API Platform · Artificial Analysis · OpenRouter · VentureBeat · SCMP

FAQ

Ja — kostenloses Konto auf kimi.com, K3 im Max-Modus. API: $3/$15 pro 1M Tokens. Budget planen: Mietpreise.

Vollständige Gewichte ab 27.7.2026 auf Hugging Face. Produktion: 64+ Beschleunigerkarten Supernode; Consumer-Deployment unrealistisch. Training: MXFP4-Gewichte + MXFP8-Aktivierung, quantisierungsfreundlich.

K3: fast doppelte Parameter, 8× Kontext, stärkere Coding-/Dokument-Benchmarks. DeepSeek V4 Pro: Output $3,48/M — besser bei knappem Budget. Details: Hilfezentrum.

Ja für vollständige Codebase-Analyse, lange Rechts-/Forschungsdokumente und Agent-Langzeitgedächtnis. Flat-Pricing ohne Längenzuschlag; 90 %+ Cache-Treffer halten Kosten niedrig.

Moonshot kündigt low- und high-Modi für spätere Updates an. Derzeit nur Max-Modus verfügbar.