Kimi K3 심층 리뷰
2.8T 파라미터 오픈소스 LLM 신기록

KDA 아키텍처 · 100만 token 컨텍스트 · 벤치마크 전체 · 요금 비교 · API 접속 · 7/27 오픈 가중치

Kimi K3 2.8T 파라미터 오픈소스 LLM 심층 리뷰 2026
2026년 7월 16일 밤, Moonshot AI(월지암면)가 API 문서 상단에 Kimi K3 출시를 조용히 공지했습니다. 대규모 발표회 없이 전 세계 파라미터 규모가 가장 큰 오픈소스 AI 모델(2.8T)을 내놓았습니다. 팀에서 프로그래밍 Agent를 선정하거나 Claude Fable 5·GPT-5.6 Sol과 비교 중이거나, 최강 오픈소스 가중치 공개를 기다리는 경우 본문은 ① KDA/AttnRes/Stable LatentMoE 아키텍처가 해결하는 문제, ② SWE Marathon·OmniDocBench 등 핵심 벤치마크 성능, ③ $3/$15 요금·4가지 접속 방식·7월 27일 전체 가중치 오픈의 의미를 정리합니다.
01

Kimi K3란? 2.8T 파라미터 오픈소스 LLM 핵심 사양

2026년 7월 16일 Moonshot AI가 Kimi K3를 공개했습니다. 2.8T(2.8조) 파라미터의 희소 MoE 모델로, 이전 기록 보유 모델 DeepSeek V4 Pro(1.6T)보다 약 75% 크고, 샤오미 오픈소스 모델(1.02T)의 2.7배, Alibaba(397B)의 7배 이상입니다. 조용한 출시와 거대한 규모가 대비됩니다. 기술 블로그·요금 페이지·즉시 호출 가능한 모델 ID kimi-k3만으로 전달되었습니다.

K3는 896개 전문가 중 16개를 활성화(희소도 1.8%)하며, 100만 token 초장문 컨텍스트와 네이티브 시각 이해를 갖추고 복잡한 프로그래밍·장문 문서 추론·지식 업무에 맞춰 설계되었습니다. 한 줄로 요약하면, 오픈소스·이미지·영상 네이티브 이해·초장기 기억을 갖춘 프로그래밍 특화 AI이며 Claude Opus 4.8 대비 약 40% 저렴하고, 7월 27일 전체 가중치가 공개됩니다.

01

규모 충격: DeepSeek 부상 이후 Moonshot AI 점유율이 크게 줄었고, K3는 전략적 반격입니다. 지난 12개월 중 Kimi 시리즈가 9개월간 오픈소스 모델 규모 상한을 차지했습니다.

02

출시 타이밍: 2026 세계 AI 대회(WAIC) 개막 전야에 맞춰 공개되었으며, 7월 17–20일 추가 발표가 예상됩니다.

03

상업화 가속: 2026년 6월 기준 ARR 3억 달러를 돌파했고, 올해 6차 펀딩을 완료해 사전 가치 315억 달러를 기록했습니다. API 매출 비중 70% 이상, 해외 유료 사용자 400% 증가를 보고합니다.

04

장문 컨텍스트 과제: 기존 full attention은 100만 token에서 KV 캐시 메모리가 폭증합니다. K3의 KDA 메커니즘은 이 문제를 위해 설계되었습니다.

05

프로그래밍 Agent 수요: SWE Marathon 등 장시간 코드 작업은 수 시간 세션에서 컨텍스트 연속성이 필요하며, 1M 윈도우와 90% 이상 캐시 적중이 핵심 판매 포인트입니다.

항목수치
총 파라미터2.8T(세계 최대 오픈소스 모델)
아키텍처KDA + AttnRes + Stable LatentMoE
활성 전문가16 / 896(희소 MoE, 1.8%)
컨텍스트 윈도우1,048,576 tokens(1M)
입력 모달리티텍스트·이미지·영상
추론 모드Always-on max effort(low/high 후속 업데이트)
오픈 가중치2026년 7월 27일 Hugging Face
02

Kimi K3 아키텍처 혁신과 벤치마크: KDA, AttnRes, Stable LatentMoE

Kimi Delta Attention(KDA)은 혼합 선형 attention 메커니즘입니다. 3:1 비율로 선형 attention 레이어와 full attention 레이어를 교차 배치합니다. 3개 선형 레이어가 국소 구조를 저비용으로 처리하고, 1개 full attention 레이어가 전역 정보 흐름을 유지합니다. 결과적으로 KV 캐시 메모리가 최대 75% 감소하고, 100만 token 컨텍스트에서 디코딩 속도가 최대 6.3배 향상되며, 짧은·긴 컨텍스트와 강화학습 확장 시나리오 모두에서 pure full attention 기준선을 넘어섭니다.

Attention Residuals(AttnRes)는 깊이 차원 잔차 연결을 개조합니다. 표준 잔차는 초기 레이어의 핵심 표현을 희석시키는데, AttnRes는 선택적 검색을 도입해 모델이 깊이를 건너 더 이른 레이어의 고가치 표현을 직접 끌어올 수 있습니다. 학습 효율이 약 25% 향상되며 추가 연산 부담은 2% 미만입니다.

Stable LatentMoE는 896 전문가·16 활성의 극단적 희소도에서도 안정적으로 학습합니다. 관련 기술은 다음과 같습니다.

기술역할
Quantile Balancing라우터 점수 분위수에서 전문가 할당을 직접 도출, 휴리스틱 하이퍼파라미터 제거
Per-Head Muonattention head별 독립 최적화로 대규모 학습 적응성 향상
Sigmoid Tanh Unit(SiTU)활성 함수 제어 개선
Gated MLAattention 선택성 강화

위 혁신을 종합하면 K3는 Kimi K2 대비 전체 확장 효율이 약 2.5배 향상되었습니다. Moonshot AI 자체 벤치마크는 다음과 같습니다(모델별 추론 harness 사용, 독립 제3자 재현은 진행 중).

벤치마크Kimi K3Claude Fable 5GPT-5.6 SolClaude Opus 4.8GLM-5.2
DeepSWE67.570.073.059.046.2
Program Bench77.876.877.671.963.7
Terminal Bench 2.188.384.688.884.682.7
FrontierSWE81.286.671.366.767.3
SWE Marathon42.035.039.040.013.0
BrowseComp91.288.090.484.3
Automation Bench30.829.129.727.212.9
GPQA-Diamond93.592.694.191.091.2
MMMU-Pro(시각)81.681.283.078.9
OmniDocBench91.189.885.887.9

SWE Marathon은 지속적 장기 코드 작업을 측정합니다. K3는 42.0으로 1위를 기록했습니다. Artificial Analysis Intelligence Index v4.1에서 K3는 57.1점으로 4위이며 Claude Fable 5(59.9)·GPT-5.6 Sol(58.9) 직후로, 격차는 2.8점에 불과합니다.

03

Kimi K3 요금은? Claude·GPT·DeepSeek 비용 비교

K3 표준 요금은 Claude Sonnet 5와 동일($3/$15 per 1M tokens)하지만 컨텍스트 윈도우는 5배(1M vs 200K)입니다. 캐시 적중 시 입력은 $0.30/M(표준가의 1/10)이며, Moonshot AI는 프로그래밍 시나리오에서 캐시 적중률 90%를 초과한다고 보고합니다. OpenRouter 7일 가중 평균으로 실효 입력 비용은 약 $0.55/M입니다.

모델입력($/M)출력($/M)캐시 적중 입력컨텍스트
Kimi K3$3.00$15.00$0.301M
Claude Sonnet 5$3.00(프로모 $2)$15.00(프로모 $10)200K
Claude Opus 4.8$5.00$25.00200K
GPT-5.5$5.00$30.00400K
DeepSeek V4 Pro$1.74$3.48$0.145128K
Kimi K2.6$0.95$4.00$0.16256K

Claude Opus 4.8 대비 K3는 다수 벤치마크에서 우위이며 입력 비용 60%·출력 비용 40% 수준입니다. 중국 API 요금은 입력 ¥20/M·출력 ¥100/M·캐시 적중 ¥2/M이며, Kimi.com 무료 계정으로 소비자 버전을 이용할 수 있고 선불 패키지는 ¥199부터 제공됩니다(8월 11일까지 할인).

04

Kimi K3를 바로 쓰려면? 4가지 접속과 6단계 Runbook

01

Kimi 웹/App(가장 간단): kimi.com에 접속해 계정을 등록합니다(Google 계정 지원). K3는 기본 최대 추론 강도로 동작하며 신용카드가 필요 없습니다.

02

API Key 발급: platform.kimi.ai에서 개발자 계정을 등록하고 API Key를 생성·충전합니다.

03

OpenAI 호환 클라이언트 설정: base_url="https://api.moonshot.ai/v1", 모델 ID kimi-k3를 지정합니다.

04

OpenRouter 접속: 모델 ID moonshotai/kimi-k3, Moonshot 공식 요금 그대로 1M 컨텍스트 전체 지원.

05

Prompt Caching 활성화: 프로그래밍 워크플로에서 대화 라우팅 캐시 키를 설정해 90% 이상 적중률로 실효 입력 비용을 약 $0.55/M까지 낮춥니다.

06

7월 27일 일정 표시: 전체 가중치가 Hugging Face에 공개되며 MXFP4/NVFP4 양자화판과 vLLM·SGLang Day-0 지원이 예상됩니다. 프로덕션 배포에는 64장 이상 가속 카드 초노드가 필요합니다.

Python
from openai import OpenAI

client = OpenAI(
    api_key="your_moonshot_api_key",
    base_url="https://api.moonshot.ai/v1"
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "이 코드를 분석해 주세요..."}]
)

오픈 일정: 7월 17–20일 WAIC에서 추가 발표 예상 → 7월 27일 K3 전체 가중치 공개로 2T를 넘는 최초 다운로드 가능 오픈소스 가중치가 됩니다.

05

Kimi K3를 어떻게 고를까? 시나리오 매트릭스와 인용 가능 데이터

시나리오추천 모델이유
지속적 장기 코드 작업Kimi K3SWE Marathon 1위, 1M 컨텍스트 최장
복잡 Repo 수준 버그 수정Claude Fable 5FrontierSWE 86.6으로 크게 앞섬
터미널·툴체인 집약 AgentGPT-5.6 SolTerminal Bench 2.1·Coding Agent Index 선두
초장문 문서·멀티모달 이해Kimi K3OmniDocBench 91.1 1위, 네이티브 시각 + 1M
비용 민감 시나리오DeepSeek V4 Pro출력 $3.48/M로 K3보다 훨씬 저렴
자체 배포(7/27 이후)Kimi K3최강 오픈 가중치, MXFP4 양자화 친화
A

파라미터 규모: 2.8T, DeepSeek V4 Pro(1.6T) 대비 약 75% 초과, 7/27 이후 최대 다운로드 가능 오픈소스 모델.

B

KDA 효율: KV 캐시 -75%, 100만 token 디코딩 +6.3×, 학습 확장 효율 +2.5×(vs K2).

C

Intelligence Index: Artificial Analysis v4.1 57.1점, 오픈소스 최고, 폐쇄형 플래그십과 2.8점 차.

주의: 위 벤치마크는 Moonshot AI 자체 보고입니다. K3는 Kimi Code, GPT는 Codex, Claude는 Claude Code 각자 harness를 사용했으며, 독립 제3자 재현은 진행 중이므로 방향성 참고로만 활용하십시오.

Kimi K3는 단순 파라미터 경쟁이 아닙니다. KDA·AttnRes·Stable LatentMoE는 실질적 엔지니어링 혁신이며, 프로그래밍 장기 작업·문서 이해 분야에서 일부 폐쇄형 플래그십과 대등하거나 앞섭니다. API만으로도 빠르게 시작할 수 있지만, 로컬 Mac은 장시간 Kimi Code Agent 루프에서 메모리 압박·IDE 상주 오버헤드를 겪기 쉽고 클라우드 VM은 Metal 호환 손실이 있습니다. 7×24 프로그래밍 Agent·병렬 dev server·추론 상주가 필요한 엔지니어링 팀에는 MESHLAUNCH Mac Mini 클라우드 베어메탈 대여가 일반적으로 더 나은 선택입니다. Apple Silicon 전용, 일·주·월 유연 계약으로 iOS CI/CD·AI Agent 자동화 프로덕션에 적합합니다. 요금은 대여 가격 페이지, 배포 문의는 고객 센터를 참고하십시오.

참고: Moonshot AI 공식 블로그 · Kimi API Platform 문서 · Artificial Analysis · OpenRouter 요금 · VentureBeat · SCMP

FAQ

가능합니다. kimi.com에서 무료 계정을 등록하면 K3를 사용할 수 있습니다. API 호출은 유료($3/$15 per 1M tokens)입니다. 예산 계획은 대여 가격 페이지를 참고하십시오.

전체 가중치는 2026년 7월 27일 Hugging Face에서 공개됩니다. 프로덕션급 배포에는 64장 이상 가속 카드 초노드가 필요하며 소비자급 로컬 배포는 현실적이지 않습니다. MXFP4 가중치 + MXFP8 활성으로 학습되어 양자화에 유리합니다.

K3는 파라미터 약 2배, 컨텍스트 8배, 프로그래밍·문서 이해 벤치마크에서 더 강합니다. DeepSeek V4 Pro는 출력 $3.48/M로 비용 민감 시나리오에 유리합니다. 자세한 내용은 고객 센터를 참고하십시오.

전체 코드베이스 일괄 분석, 장문 법률·연구 문서, 다회차 Agent 장기 기억 시나리오에서 매우 유용합니다. flat 요금에 길이 추가 비용이 없고 90% 이상 캐시 적중과 결합하면 실제 비용을 통제하기 쉽습니다.

Moonshot AI는 low·high 강도 모드를 후속 업데이트에서 제공할 예정이며, 현재는 max 모드만 사용 가능합니다.