Kimi K3 Open Weight: почему релиз 27 июля меняет расклад
Kimi K3 — sparse MoE с 2,8 трлн total parameters, ~104 млрд activated parameters на forward pass, контекст 1 млн токенов и нативное vision understanding. Веса на Hugging Face — ~1,56 TB; в первые 30 минут репозиторий moonshotai/Kimi-K3 вышел на #1 trending. От API-релиза на kimi.com до публикации полных весов прошло 11 дней.
16 июля (накануне WAIC 2026): K3 в kimi.com, Kimi Work, Kimi Code и Kimi API — только online inference, веса закрыты. Техблог: «Kimi K3: Open Frontier Intelligence».
17 июля: Отраслевой разбор архитектуры; Xinhua называет K3 крупнейшей на тот момент open weight моделью по total params.
22–23 июля: Эскалация спора о model distillation. Michael Kratsios (White House) обвиняет Moonshot в «масштабной скрытой дистилляции» Claude Fable; Scott Bessent заявляет о возможных санкциях и entity list.
27 июля ~23:00: Публикация полных весов, technical report и open-source MoonEP + AgentEnv (FlashKDA уже был открыт ранее).
28 июля: Минкоммерс КНР отвечает на AI-спор с США; китайские СМИ детализируют условия open weight drop.
Три дня спустя Alibaba (инвестор Moonshot) анонсировала Qwen3.8-Max-Preview на 24T параметров — прямой ответ на K3. Гонка вошла в фазу «3T club».
Спецификация K3 и SWE-bench: сравнение с frontier
Цифры разных лабораторий и harness'ов расходятся; ниже — vendor specs плюс независимые re-run. Self-reported metrics помечены отдельно.
| Параметр | Kimi K3 | Комментарий |
|---|---|---|
| Total parameters | 2,8T | Первый полный open weight drop ~3T-класса |
| Activated parameters | ~104B | Sparse MoE routing |
| Expert config | 896 routed experts, 16 active/token | Sparsity ~1,8% |
| Context window | 1M tokens | Гибрид KDA + Gated MLA |
| Weight footprint | ~1,56 TB | MXFP4 weights + MXFP8 activations |
| License | Custom open weight | Официально «open weight», не «open source» |
SWE-bench Verified (независимый re-run, Vals AI, июль 2026)
| Модель | Score | Дата релиза |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96,2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93,4% | 2026-07-16 |
| Qwen3.7-Max | 79,4% | 2026-05-19 |
| DeepSeek-V4 | 76,2% | 2026-04-23 |
K3 — потолок open weight по capability, не по cost-efficiency: Artificial Analysis Intelligence Index #3 глобально, #1 среди open weight; cost per task ~$0,95 против ~$0,47 у GLM-5.2.
KDA, AttnRes, Per-Head Muon и open-source Infra
K3 перепроектирует три устоявшихся блока transformer stack — attention, residual path, optimizer — вместо naive scaling total params.
Kimi Delta Attention (KDA) заменяет scalar forget gate Gated DeltaNet на per-channel decay: каждая feature dimension получает собственный коэффициент затухания; chunkwise DPLR recurrence даёт linear-time complexity. KDA чередуется с редкими global attention слоями (Gated MLA) — 1M контекст при минимальном KV cache footprint.
Attention Residuals (AttnRes) делает residual aggregation input-dependent: каждый слой динамически взвешивает outputs всех предыдущих слоёв. Overhead — один RMSNorm и pseudo-query vector на слой; training efficiency +~25% при <2% parameter overhead.
Per-Head Muon даёт каждому attention head независимую optimizer trajectory. В связке с Stable LatentMoE (896→16 routing + Quantile Balancing) Moonshot доказывает theoretical upper bound на redundant experts per compute node.
| Компонент | Роль | Ключевая capability |
|---|---|---|
| MoonEP | Fine-grained MoE communication at scale | Ephemeral replication overloaded experts; равномерное token distribution per node; доказанный bound redundant experts |
| FlashKDA | CUTLASS-based KDA kernel | Prefill на H20: 1,72–2,22× vs baseline; drop-in backend для chunk_kda |
| AgentEnv | Firecracker microVM agent sandbox | Checkpoint latency 133 ms, restore 49 ms, memory oversubscription до 6,5× (vendor data, third-party re-run pending) |
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
Заметка: Релиз — не только tarball весов. MoonEP, FlashKDA и AgentEnv закрывают training/inference loop, который делает 2,8T MoE operable — именно поэтому drop получил сильный отклик в infra-сообществе.
Интеграция и deployment: шестишаговый Runbook
Выбор пути: API Moonshot, OpenRouter third-party hosting или self-host на 64+ GPU supernode. Для indie и SMB — API/OpenRouter; self-host только при доказанном TCO и compliance mandate.
Moonshot API: Endpoint https://api.moonshot.ai/v1, model ID kimi-k3, OpenAI SDK-compatible — достаточно сменить base_url и API key.
Cache strategy: Mooncake disaggregated inference на coding workloads даёт cache hit rate >90%; effective input cost ближе к $0,30/M (cache hit), не к $3,00/M (cache miss).
Self-host (optional): Скачать ~1,56 TB из Hugging Face moonshotai/Kimi-K3, подготовить 64+ GPU supernode, настроить expert parallelism + tensor parallelism.
License review: Проверить триггеры MaaS $20M annual revenue и MAU 100M / monthly revenue $20M display threshold до production rollout.
Infra toolchain: Для KDA kernel — переключить flash-linear-attention backend chunk_kda на FlashKDA; для large-scale agent RL — оценить интеграцию AgentEnv sandbox.
Лицензионные пороги и hard numbers API pricing
Open weight vs open source: Moonshot последовательно использует термин «open weight». По OSI: публичны weights, technical report и inference infra; training data и full training code — нет.
MaaS revenue threshold: Model-as-a-Service с cumulative revenue >$20M за 12 месяцев — обязательное commercial agreement с Moonshot AI.
API pricing (per 1M tokens): input cache hit $0,30, cache miss $3,00, output (включая reasoning trace) $15,00. Artificial Analysis measured cost per task ~$0,95 — ~60% дешевле Claude Fable 5 (~$2,4/task).
Ограничение: 2,8T params и 896 experts исключают inference на consumer GPU. На OpenRouter K3 уже у 7 провайдеров; pricing в основном parity с official API.
Agent orchestration, CI/CD pipeline или long-running Gateway на локальном Mac — sleep, update prompts и memory ceiling рвут long-horizon agent tasks. Self-host K3 на consumer iron нереалистичен; inference — через API, orchestration — на стабильном cloud node. Для production 7×24 iOS CI/CD и AI agent automation аренда cloud Mac Mini MESHLAUNCH обычно оптимальнее: dedicated Apple Silicon, daily/weekly/monthly billing, inference offload на API, build и agent state на always-on узле. Тарифы — страница цен, onboarding — центр помощи.
Строго говоря, нет. Это open weight модель: публичны обученные веса, technical report и часть inference-инфраструктуры, но training data и полный training stack не раскрыты — критерии OSI не выполняются.
В большинстве сценариев — да. Исключения: MaaS с годовым доходом >$20M или продукт с MAU >100M / месячным доходом >$20M. Cloud dev environment — на странице цен.
Официальная рекомендация — кластер 64+ GPU в supernode-конфигурации. Для большинства команд реалистичнее API Moonshot или OpenRouter. Конфигурация cloud Mac — в центре помощи.
Потолок open weight: Artificial Analysis Intelligence Index #3 глобально (после Claude Fable 5 и GPT-5.6 Sol), #1 среди open weight. SWE-bench Verified 93,4%. Cost per task выше GLM-5.2. K3 — #1 на Arena.ai Frontend Code Arena.
K3 — ~3× total params K2.5, новые Attention Residuals и Per-Head Muon, контекст 1M и нативное vision. Лицензия K3 добавляет MaaS revenue threshold — коммерческие ограничения детальнее, чем у K2 series. См. также обзор K3 от 17.07.