Kimi K3 전면 오픈웨이트: 이번 발표가 주목받는 이유
Kimi K3는 총 2.8조 파라미터의 혼합 전문가(MoE) 모델로, 활성 파라미터는 약 1,040억이며 100만 토큰 컨텍스트 윈도우와 네이티브 시각 이해를 지원합니다. Hugging Face 가중치 파일 용량은 약 1.56TB이며, 공개 30분 만에 트렌딩 1위에 올랐습니다. 이번 오픈웨이트 공개는 kimi.com·API 최초 출시로부터 단 11일 만에 이루어졌습니다.
7월 16일 밤(WAIC 2026 전야): Kimi K3가 kimi.com, Kimi Work, Kimi Code, Kimi API에서 최초 공개되었으나 온라인 호출만 가능하고 가중치는 비공개였습니다. 공식 기술 블로그 제목은 《Kimi K3: Open Frontier Intelligence》입니다.
7월 17일: 업계가 아키텍처를 집중 분석하기 시작했으며, 신화통신은 이를 「현재 전 세계 파라미터 규모가 가장 큰 오픈 모델」로 보도했습니다.
7월 22일–23일: 미중 「모델 증류」 분쟁이 격화되었습니다. 미국 백악관 과학기술 고문 Michael Kratsios가 Moonshot AI의 Anthropic Fable 모델에 대한 「대규모·은밀한 산업화 증류」를 지적했고, 재무장관 Scott Bessent는 관련 중국 기업에 대한 제재·실체 목록 제한을 검토하겠다고 밝혔습니다.
7월 27일 23시: Moonshot AI가 K3 전체 가중치·기술 보고서를 공식 발표하고 MoonEP·AgentEnv를 오픈했습니다(FlashKDA는 이전에 이미 공개).
7월 28일: 중국 상무부가 미중 AI 분쟁에 공개 대응하며 미국의 「AI 패권주의」를 비난하고 반제 조치를 경고했으며, 국내 언론이 이번 오픈웨이트 세부를 집중 보도했습니다.
3일 후 알리바바(Moonshot AI 투자자 중 하나)가 24조 파라미터 Qwen3.8-Max-Preview를 발표했으며, 이는 K3에 대한 직접적 대응으로 해석되었습니다. 국산 대형 모델 경쟁이 「3T 클럽」 단계에 진입했습니다.
Kimi K3 핵심 파라미터·벤치마크: GPT-5.6 Sol·Claude와 비교
기관·평가 프레임워크마다 수치 차이가 크므로, 아래는 독립 제3자 재현 데이터를 우선 인용하며 제조사 자체 보고는 별도 표기합니다.
| 항목 | Kimi K3 | 비고 |
|---|---|---|
| 총 파라미터 | 2.8조(2.8T) | 전 세계 최초 완전 공개 3T급 모델 |
| 활성 파라미터 | 약 1,040억 | MoE 희소 활성화 |
| 전문가 구성 | 896개 라우팅 전문가, 토큰당 16개 활성 | 희소도 약 1.8% |
| 컨텍스트 윈도우 | 100만 토큰 | KDA + Gated MLA 혼합 어텐션 |
| 가중치 용량 | 약 1.56TB | MXFP4 가중치 + MXFP8 활성화 |
| 라이선스 | 커스텀 라이선스 | 공식 표현은 「open weight」이지 「open source」가 아님 |
SWE-bench Verified(독립 재현, Vals AI, 2026년 7월 기준)
| 모델 | 점수 | 출시일 |
|---|---|---|
| Claude Opus 5 | 97% | 2026-07-24 |
| GPT-5.6 Sol | 96.2% | 2026-07-09 |
| Claude Fable 5 | 95% | 2026-06-09 |
| Kimi K3 | 93.4% | 2026-07-16 |
| Qwen3.7-Max | 79.4% | 2026-05-19 |
| DeepSeek-V4 | 76.2% | 2026-04-23 |
Kimi K3는 오픈웨이트 진영에서 능력 상한이 가장 높은 선택지이지, 가성비 최적은 아닙니다. Artificial Analysis 지능 지수 글로벌 3위·오픈웨이트 1위이나 태스크당 비용은 약 $0.95로 GLM-5.2의 약 $0.47/태스크보다 높습니다.
KDA·AttnRes·Per-Head Muon과 3대 오픈 인프라 기술
Kimi K3는 딥러닝에서 수십 년간 쓰인 어텐션·잔차 연결·옵티마이저 세 가지 전통 컴포넌트를 재설계했으며, 이것이 단순 파라미터 적층과 구별되는 핵심입니다.
Kimi Delta Attention(KDA)는 기존 Gated DeltaNet의 스칼라 망각 게이트를 채널별로 확장합니다. 각 특징 차원이 독립 감쇠율을 갖고 chunkwise DPLR 공식으로 선형 시간 재귀를 구현합니다. K3는 KDA와 소수의 전역 어텐션 레이어(Gated MLA)를 교차 혼합해 100만 토큰 컨텍스트를 지원하면서 KV Cache 오버헤드를 극도로 낮춥니다.
Attention Residuals(AttnRes)는 잔차 연결을 「전 레이어 균등 합산」에서 입력에 따라 선택적으로 이전 모든 레이어 출력을 동적 집계하는 방식으로 바꿉니다. 레이어당 RMSNorm 하나와 pseudo-query 벡터만 추가해 약 25% 학습 효율 향상을 달성하며 비용은 2% 미만입니다.
Per-Head Muon은 각 어텐션 헤드가 독립적으로 학습해 더 적응적인 수렴 경로를 갖습니다. Stable LatentMoE(896 중 16 희소 라우팅 + Quantile Balancing 균형 전략)와 결합해 각 연산 노드의 중복 전문가 수 이론 상한을 수학적으로 증명했습니다.
| 기술 | 역할 | 핵심 능력 |
|---|---|---|
| MoonEP | 초대규모 세밀 MoE 통신 라이브러리 | 과부하 전문가 임시 복제로 각 노드에 균등 토큰 수 보장; 중복 전문가 수 이론 상한 증명 |
| FlashKDA | CUTLASS 기반 KDA 고성능 연산자 | H20에서 prefill 속도 1.72–2.22배 향상; chunk_kda 백엔드 직접 대체 가능 |
| AgentEnv | Firecracker microVM 에이전트 샌드박스 | checkpoint 지연 133ms·복구 49ms·메모리 오버커밋 최대 6.5배(공식 데이터, 제3자 재현 전) |
from openai import OpenAI
client = OpenAI(
api_key="YOUR_MOONSHOT_API_KEY",
base_url="https://api.moonshot.ai/v1"
)
completion = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "Explain Kimi Delta Attention"}]
)
참고: Moonshot AI는 가중치 파일만 공개한 것이 아니라 K3 학습 효율·안정성을 뒷받침하는 3대 인프라 기술도 함께 오픈했으며, 이것이 개발자 커뮤니티에서 높은 평가를 받은 주요 이유입니다.
Kimi K3 접속·배포: 6단계 Runbook
접속 경로 확인: 팀이 API 호출, OpenRouter 제3자 호스팅, 64장 이상 초노드 자체 배포 중 어느 경로가 필요한지 평가합니다. 개인 개발자·대부분 중소 팀에게 API 또는 OpenRouter가 현실적입니다.
Moonshot API 등록: https://api.moonshot.ai/v1에서 API Key를 발급받습니다. 모델 ID는 kimi-k3이며 OpenAI SDK와 호환되므로 대부분 기존 프로젝트는 base URL과 키만 변경하면 됩니다.
캐시 전략 구성: Mooncake 분리형 추론 아키텍처는 전형적 코딩 워크로드에서 캐시 적중률 90% 이상을 달성하며, 실제 비용은 입력 $3.00/M(캐시 미적중)보다 $0.30/M(캐시 적중)에 가깝습니다.
자체 배포 평가(선택): 로컬 가중치가 필요하면 Hugging Face moonshotai/Kimi-K3에서 약 1.56TB를 다운로드하고 64장 이상 초노드를 준비해 전문가 병렬·텐서 병렬을 구성합니다.
라이선스 검토: 사업이 Model-as-a-Service 연간 수익 2,000만 달러 문턱 또는 월간 활성 1억·월 수익 2,000만 달러 표시 문턱에 해당하는지 확인합니다.
인프라 도구체인 통합: KDA 연산자를 쓰면 flash-linear-attention 라이브러리의 chunk_kda 백엔드를 FlashKDA로 전환합니다. 대규모 Agent RL 학습은 AgentEnv 샌드박스 통합을 검토합니다.
라이선스 두 가지 상업 문턱과 API 요금 수치
오픈웨이트 vs 오픈소스: Moonshot AI 공식 자료는 「open source」가 아닌 「open weight」 표현을 일관되게 사용합니다. OSI 기준으로 K3는 가중치·기술 보고서·추론 인프라 도구만 공개했으며 학습 데이터·전체 학습 코드는 비공개입니다.
Model-as-a-Service 수익 문턱: MaaS 사업을 운영하며 연속 12개월 누적 수익이 2,000만 달러를 초과하면 Moonshot AI와 별도 상업 계약을 체결해야 합니다.
API 요금(백만 토큰당): 입력 캐시 적중 $0.30, 캐시 미적중 $3.00, 출력(추론 과정 포함) $15.00입니다. Artificial Analysis 실측 태스크당 비용은 약 $0.95로 Claude Fable 5(약 $2.4/태스크) 대비 약 60% 저렴합니다.
주의: 2.8조 파라미터·896개 전문가 규모로 K3는 소비자급 하드웨어에서 실행이 사실상 불가능합니다. OpenRouter 등 제3자 플랫폼에는 이미 7개 서비스 제공업체가 K3를 올렸으며 요금은 대부분 공식과 동일합니다.
로컬 Mac에서 Agent 오케스트레이션·CI/CD 파이프라인·장기 상주 Gateway 프로세스를 돌려야 한다면 소비자급 GPU 자체 배포 K3는 비현실적입니다. 로컬 Mac의 절전·업데이트 팝업·메모리 병목도 장기 Agent 태스크를 끊습니다. iOS CI/CD와 AI Agent 자동화를 7×24 안정 운영해야 하는 프로덕션 환경에서는 MESHLAUNCH Mac Mini 클라우드 대여가 보통 더 나은 선택입니다. 전용 Apple Silicon, 일·주·월 탄력 과금으로 추론은 API에 맡기고 오케스트레이션·빌드는 안정적인 클라우드 Mac 노드에 둘 수 있습니다. 요금은 대여 가격 페이지, 배포·절차는 고객 센터를 참고하세요.
엄밀히 말하면 아닙니다. 「오픈웨이트(open weight)」 모델로, 학습 완료 가중치·기술 보고서·일부 인프라 도구는 공개되었으나 학습 데이터와 전체 학습 코드는 비공개이며 OSI 기준 「오픈소스」 정의에 부합하지 않습니다.
대부분의 상업 시나리오에서 제한 없이 이용 가능합니다. 다만 「모델 즉 서비스」 사업 연간 수익이 2,000만 달러를 초과하거나 제품 월간 활성 1억·월 수익 2,000만 달러를 넘으면 라이선스 추가 조항을 충족해야 합니다. 클라우드 개발 환경 방안은 대여 가격 페이지를 참고하세요.
공식 권장은 64장 이상 가속기 초노드 클러스터입니다. 개인·대부분 기업은 공식 API 또는 OpenRouter 등 제3자 플랫폼 호출이 현실적입니다. 클라우드 Mac 개발 환경 구성은 고객 센터를 참고하세요.
오픈웨이트 진영에서 종합 능력이 가장 높습니다. Artificial Analysis 지능 지수 글로벌 3위로 Claude Fable 5·GPT-5.6 Sol에 이어지나, 동급 오픈웨이트 GLM-5.2 대비 비용이 높습니다. K3는 Arena.ai Frontend Code Arena 1위를 기록했습니다.
K3는 K2.5 대비 파라미터 규모가 약 3배이며 Attention Residuals·Per-Head Muon이 추가되었고 컨텍스트·멀티모달 능력이 대폭 향상되었습니다. 라이선스 측면에서 K3는 Model-as-a-Service 수익 문턱이 신설되어 K2 시리즈보다 상업 제한이 세분화되었습니다.