Kimi K3 Open Weight
2,8 трлн параметров · 1M контекст

11 дней от API до полных весов · KDA/AttnRes/MoE · лицензия, SWE-bench и API pricing

Kimi K3 Open Weight: 2,8 трлн параметров и контекст в 1 млн токенов
Вечером 27 июля 2026 Moonshot AI опубликовал полные веса Kimi K3, технический отчёт и синхронно открыл три ключевых компонента инфраструктуры — MoonEP, FlashKDA и AgentEnv. Это первый полностью открытый модельный стек уровня ~3T параметров. Материал для команд, оценивающих интеграцию K3 и compliance: 11-дневный timeline, разбор KDA/AttnRes/Per-Head Muon, независимые бенчмарки, два коммерческих порога лицензии и шестишаговый runbook API/self-host.
01

Kimi K3 Open Weight: почему релиз 27 июля меняет расклад

Kimi K3 — sparse MoE с 2,8 трлн total parameters, ~104 млрд activated parameters на forward pass, контекст 1 млн токенов и нативное vision understanding. Веса на Hugging Face — ~1,56 TB; в первые 30 минут репозиторий moonshotai/Kimi-K3 вышел на #1 trending. От API-релиза на kimi.com до публикации полных весов прошло 11 дней.

01

16 июля (накануне WAIC 2026): K3 в kimi.com, Kimi Work, Kimi Code и Kimi API — только online inference, веса закрыты. Техблог: «Kimi K3: Open Frontier Intelligence».

02

17 июля: Отраслевой разбор архитектуры; Xinhua называет K3 крупнейшей на тот момент open weight моделью по total params.

03

22–23 июля: Эскалация спора о model distillation. Michael Kratsios (White House) обвиняет Moonshot в «масштабной скрытой дистилляции» Claude Fable; Scott Bessent заявляет о возможных санкциях и entity list.

04

27 июля ~23:00: Публикация полных весов, technical report и open-source MoonEP + AgentEnv (FlashKDA уже был открыт ранее).

05

28 июля: Минкоммерс КНР отвечает на AI-спор с США; китайские СМИ детализируют условия open weight drop.

Три дня спустя Alibaba (инвестор Moonshot) анонсировала Qwen3.8-Max-Preview на 24T параметров — прямой ответ на K3. Гонка вошла в фазу «3T club».

02

Спецификация K3 и SWE-bench: сравнение с frontier

Цифры разных лабораторий и harness'ов расходятся; ниже — vendor specs плюс независимые re-run. Self-reported metrics помечены отдельно.

ПараметрKimi K3Комментарий
Total parameters2,8TПервый полный open weight drop ~3T-класса
Activated parameters~104BSparse MoE routing
Expert config896 routed experts, 16 active/tokenSparsity ~1,8%
Context window1M tokensГибрид KDA + Gated MLA
Weight footprint~1,56 TBMXFP4 weights + MXFP8 activations
LicenseCustom open weightОфициально «open weight», не «open source»

SWE-bench Verified (независимый re-run, Vals AI, июль 2026)

МодельScoreДата релиза
Claude Opus 597%2026-07-24
GPT-5.6 Sol96,2%2026-07-09
Claude Fable 595%2026-06-09
Kimi K393,4%2026-07-16
Qwen3.7-Max79,4%2026-05-19
DeepSeek-V476,2%2026-04-23

K3 — потолок open weight по capability, не по cost-efficiency: Artificial Analysis Intelligence Index #3 глобально, #1 среди open weight; cost per task ~$0,95 против ~$0,47 у GLM-5.2.

03

KDA, AttnRes, Per-Head Muon и open-source Infra

K3 перепроектирует три устоявшихся блока transformer stack — attention, residual path, optimizer — вместо naive scaling total params.

Kimi Delta Attention (KDA) заменяет scalar forget gate Gated DeltaNet на per-channel decay: каждая feature dimension получает собственный коэффициент затухания; chunkwise DPLR recurrence даёт linear-time complexity. KDA чередуется с редкими global attention слоями (Gated MLA) — 1M контекст при минимальном KV cache footprint.

Attention Residuals (AttnRes) делает residual aggregation input-dependent: каждый слой динамически взвешивает outputs всех предыдущих слоёв. Overhead — один RMSNorm и pseudo-query vector на слой; training efficiency +~25% при <2% parameter overhead.

Per-Head Muon даёт каждому attention head независимую optimizer trajectory. В связке с Stable LatentMoE (896→16 routing + Quantile Balancing) Moonshot доказывает theoretical upper bound на redundant experts per compute node.

КомпонентРольКлючевая capability
MoonEPFine-grained MoE communication at scaleEphemeral replication overloaded experts; равномерное token distribution per node; доказанный bound redundant experts
FlashKDACUTLASS-based KDA kernelPrefill на H20: 1,72–2,22× vs baseline; drop-in backend для chunk_kda
AgentEnvFirecracker microVM agent sandboxCheckpoint latency 133 ms, restore 49 ms, memory oversubscription до 6,5× (vendor data, third-party re-run pending)
Python · OpenAI SDK compatible
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_MOONSHOT_API_KEY",
    base_url="https://api.moonshot.ai/v1"
)

completion = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)

Заметка: Релиз — не только tarball весов. MoonEP, FlashKDA и AgentEnv закрывают training/inference loop, который делает 2,8T MoE operable — именно поэтому drop получил сильный отклик в infra-сообществе.

04

Интеграция и deployment: шестишаговый Runbook

01

Выбор пути: API Moonshot, OpenRouter third-party hosting или self-host на 64+ GPU supernode. Для indie и SMB — API/OpenRouter; self-host только при доказанном TCO и compliance mandate.

02

Moonshot API: Endpoint https://api.moonshot.ai/v1, model ID kimi-k3, OpenAI SDK-compatible — достаточно сменить base_url и API key.

03

Cache strategy: Mooncake disaggregated inference на coding workloads даёт cache hit rate >90%; effective input cost ближе к $0,30/M (cache hit), не к $3,00/M (cache miss).

04

Self-host (optional): Скачать ~1,56 TB из Hugging Face moonshotai/Kimi-K3, подготовить 64+ GPU supernode, настроить expert parallelism + tensor parallelism.

05

License review: Проверить триггеры MaaS $20M annual revenue и MAU 100M / monthly revenue $20M display threshold до production rollout.

06

Infra toolchain: Для KDA kernel — переключить flash-linear-attention backend chunk_kda на FlashKDA; для large-scale agent RL — оценить интеграцию AgentEnv sandbox.

05

Лицензионные пороги и hard numbers API pricing

A

Open weight vs open source: Moonshot последовательно использует термин «open weight». По OSI: публичны weights, technical report и inference infra; training data и full training code — нет.

B

MaaS revenue threshold: Model-as-a-Service с cumulative revenue >$20M за 12 месяцев — обязательное commercial agreement с Moonshot AI.

C

API pricing (per 1M tokens): input cache hit $0,30, cache miss $3,00, output (включая reasoning trace) $15,00. Artificial Analysis measured cost per task ~$0,95 — ~60% дешевле Claude Fable 5 (~$2,4/task).

Ограничение: 2,8T params и 896 experts исключают inference на consumer GPU. На OpenRouter K3 уже у 7 провайдеров; pricing в основном parity с official API.

Agent orchestration, CI/CD pipeline или long-running Gateway на локальном Mac — sleep, update prompts и memory ceiling рвут long-horizon agent tasks. Self-host K3 на consumer iron нереалистичен; inference — через API, orchestration — на стабильном cloud node. Для production 7×24 iOS CI/CD и AI agent automation аренда cloud Mac Mini MESHLAUNCH обычно оптимальнее: dedicated Apple Silicon, daily/weekly/monthly billing, inference offload на API, build и agent state на always-on узле. Тарифы — страница цен, onboarding — центр помощи.

FAQ

Строго говоря, нет. Это open weight модель: публичны обученные веса, technical report и часть inference-инфраструктуры, но training data и полный training stack не раскрыты — критерии OSI не выполняются.

В большинстве сценариев — да. Исключения: MaaS с годовым доходом >$20M или продукт с MAU >100M / месячным доходом >$20M. Cloud dev environment — на странице цен.

Официальная рекомендация — кластер 64+ GPU в supernode-конфигурации. Для большинства команд реалистичнее API Moonshot или OpenRouter. Конфигурация cloud Mac — в центре помощи.

Потолок open weight: Artificial Analysis Intelligence Index #3 глобально (после Claude Fable 5 и GPT-5.6 Sol), #1 среди open weight. SWE-bench Verified 93,4%. Cost per task выше GLM-5.2. K3 — #1 на Arena.ai Frontend Code Arena.

K3 — ~3× total params K2.5, новые Attention Residuals и Per-Head Muon, контекст 1M и нативное vision. Лицензия K3 добавляет MaaS revenue threshold — коммерческие ограничения детальнее, чем у K2 series. См. также обзор K3 от 17.07.