deepseek-chat을 쓰고 있거나 GPT-5.6·Claude Fable 5와 가성비를 비교 중이거나, 7월 24일 마감 전 API 마이그레이션을 준비해야 한다면 본문에서 ① 프리뷰부터 GA까지의 전체 타임라인, ② CSA+HCA 아키텍처가 100만 token 컨텍스트를 지탱하는 방식, ③ 벤치마크 점수·피크 요금표·6단계 마이그레이션 Runbook을 정리합니다.
DeepSeek V4 GA에서 무엇이 출시되었나? 프리뷰부터 풀버전까지 타임라인
2026년 7월 20일 DeepSeek V4 풀버전(General Availability)이 정식 출시되었습니다. 완전히 새로운 아키텍처는 아닙니다. 4월 24일에 오픈소스로 공개된 MoE 설계는 그대로이며, 프리뷰의 안정성·성능 최적화·상업화 과금 체계가 완성된 졸업 버전입니다. 풀버전은 Agent 능력, 수학 추론, 코드 생성에 집중 개선이 이루어졌고, 정식 상업화 요금 체계가 함께 적용되어 DeepSeek이 「거의 무료」에서 체계적인 상업 운영으로 전환하는 이정표가 되었습니다.
| 시점 | 이벤트 |
|---|---|
| 2026-04-24 | V4 프리뷰 출시 + 오픈소스(MIT), V4-Pro(1.6T)·V4-Flash(284B) 포함 |
| 2026-05 | V4-Flash·V4-Pro 프로덕션 튜닝 버전 출시, API 정식 가용 |
| 2026-06 | V4-Pro 가격 영구 75% 인하(출력가 $0.87/M tokens) |
| 2026-06-29 | 전체 API 사용자에 GA 7월 중순 출시·피크·오프피크 요금 최초 공지 이메일 발송 |
| 2026-07-19 | 다수 개발자에게 GA 그레이스케일 베타 자격 부여 |
| 2026-07-20 | GA 정식판 출시(본문 게시일) |
| 2026-07-24 | 구 인터페이스명 deepseek-chat·deepseek-reasoner 영구 중단 |
마이그레이션 긴급성: 구 모델명 deepseek-chat·deepseek-reasoner은 7월 24일 23:59(베이징 시간)에 영구 중단되므로 프로덕션 환경은 4일 안에 전환을 완료해야 합니다.
과금 복잡도 상승: GA에서 피크·오프피크 차등 요금이 처음 도입되었습니다. 평일 09:00–12:00·14:00–18:00 요율이 2배이므로 24/7 파이프라인 일정을 재조정해야 합니다.
성능 기대치 관리: 풀버전이 Claude Fable 5나 GPT-5.6 Ultra를 전면적으로 이기지는 못하지만, 1/10~1/100 비용으로 오픈소스 최강 성능을 제공합니다.
자체 호스팅 문턱: MIT 오픈소스이나 V4-Pro 1.6T 파라미터는 로컬 하드웨어 요구가 매우 높아 대부분의 팀은 API 또는 클라우드 고사양 Mac 추론 노드에 의존합니다.
Kimi K3와의 경쟁: Kimi K3가 2.8T 파라미터로 규모 기록을 노리는 가운데, DeepSeek은 가성비와 성숙한 API 생태계로 개발자 기반을 방어합니다.
DeepSeek V4 아키텍처 분석과 벤치마크 점수 전체 표
DeepSeek V4는 V2/V3 시대의 다중 헤드 잠재 어텐션(MLA)을 버리고 CSA(압축 희소 어텐션)와 HCA(고압축 어텐션) 하이브리드를 채택했습니다. 1M token 시나리오에서 KV Cache 메모리는 V3.2의 10%(V4-Flash는 7%)에 불과하고, 추론 FLOPs는 V3.2의 27%만 필요합니다. mHC(매니폴드 제약 하이퍼커넥션)가 4채널 잔차 스트림으로 61층 심층 네트워크를 안정화하며, 훈련에는 AdamW 대신 Muon 옵티마이저를 사용합니다.
| 사양 | V4-Pro | V4-Flash |
|---|---|---|
| 총 파라미터 | 1.6조(1.6T) | 2,840억(284B) |
| Token당 활성화 | 490억(49B) | 130억(13B) |
| Transformer 층수 | 61층 | 43층 |
| 컨텍스트 윈도우 | 1,000,000 tokens | 1,000,000 tokens |
| 최대 출력 | 384K tokens | 384K tokens |
| 정밀도 | FP4(전문가) + FP8 | FP4 + FP8 혼합 |
| 사전학습 데이터 | 33T+ tokens | 32T+ tokens |
| 오픈소스 라이선스 | MIT | MIT |
추론 모드는 세 가지입니다. Non-think(초고속, 사고 체인 없음), Think High(명시적 추론, 코드 디버깅에 적합), Think Max(최대 추론 강도, 384K+ 컨텍스트 필요, 복잡한 수학·장기 Agent에 적합). 공식 권장 샘플링 파라미터는 temperature=1.0, top_p=1.0입니다.
| 벤치마크 | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% ★ 오픈소스 최고 | 96.0% | 별도 미공개 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis 데이터에 따르면 Claude Fable 5는 Strategy & Ops 작업당 $3.48(50점), DeepSeek V4-Pro는 $0.03(38점)에 불과합니다. 비용은 116배 차이, 점수 격차는 약 12점입니다.
DeepSeek V4 vs GPT-5.6 vs Claude Fable 5 — 어떻게 선택할까?
| 차원 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| 오픈소스 / 자체 호스팅 | ✅ MIT | ❌ 폐쇄형 | ❌ 폐쇄형 |
| 컨텍스트 윈도우 | 1M tokens | 미공개 | 1M tokens |
| 코드 능력 | 매우 강함(Fable 5에 근접) | 매우 강함 | 최강(SWE-bench Pro 80.3%) |
| API 출력가(오프피크) | $0.87/M | ~$15/M | ~$50/M |
| 피크 출력가 | $1.74/M | — | — |
| Agent 능력 | 강함, 다중 Agent 오케스트레이션 지원 | 강함 | 최강 |
| 데이터 프라이버시 | ✅ 프라이빗 배포 가능 | ❌ | ❌ |
예산 제한 / 고빈도 호출 / 프라이빗 배포 → V4-Pro 또는 V4-Flash; 극한 코드 능력, 비용 무관 → Claude Fable 5; 복잡한 알고리즘 + 수학 추론 → GPT-5.6 Sol / Ultra; 초대규모 로그·문서 처리 → V4-Flash(캐시 적중 입력 $0.0028/M).
피크·오프피크 요금으로 비용 절감하기 — API 마이그레이션 6단계 Runbook(7/24 마감)
| 모델 | 과금 항목 | 오프피크(Off-Peak) | 피크(Peak) |
|---|---|---|---|
| V4-Pro | 입력(캐시 적중) | ¥0.025 / $0.0035 / 1M | 2배 |
| 입력(캐시 미적중) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 출력 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 입력(캐시 적중) | ¥0.02 / $0.0028 / 1M | 2배 |
| 입력(캐시 미적중) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 출력 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
피크 시간대(베이징 시간): 평일 09:00–12:00과 14:00–18:00입니다. 피크 시간에도 V4-Pro 출력가($1.74/M)는 Claude Opus 4.8($15/M)보다 8.6배 저렴합니다.
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
마감 경고: deepseek-chat → deepseek-v4-flash(비사고 모드); deepseek-reasoner → deepseek-v4-flash(사고 모드) 또는 deepseek-v4-pro. 7월 24일 15:59 UTC 이후 영구 중단됩니다.
구 모델명 전체 검색: 코드베이스에서 deepseek-chat·deepseek-reasoner를 검색합니다. 환경 변수·설정 파일도 포함합니다.
마이그레이션 매핑 확정: 경량 대화 → deepseek-v4-flash; 복잡한 추론 → deepseek-v4-pro + thinking 파라미터.
Staging 환경 검증: 스테이징에서 모델명을 전환하고 회귀 테스트 세트로 출력 품질 저하가 없는지 확인합니다.
Prompt Cache 구성: 고정 System Prompt를 메시지 맨 앞에 배치해 캐시 적중률을 극대화합니다(Flash 적중 $0.0028/M).
비실시간 작업 일정 조정: 대량 문서 처리·코드 리뷰 등은 18:00 이후 또는 09:00 이전에 실행해 피크 요금을 피합니다.
프로덕션 그레이스케일 배포: 7월 23일 전에 전량 전환을 완료하고 24시간 롤백 윈도우를 확보합니다. DeepSeek 과금 변경 이메일을 모니터링합니다.
DeepSeek V4 풀버전, 업그레이드할 가치가 있나? 인용 가능한 핵심 데이터
CSA 압축비: KV 시퀀스를 Softmax 게이팅 풀링으로 4배 압축합니다. V4-Pro top-1024 / V4-Flash top-512 희소 선택 + 128 token 슬라이딩 윈도우를 사용합니다.
HCA 글로벌 어텐션: Token을 128배 압축한 뒤 글로벌 밀집 어텐션을 수행하며, CSA와 교대로 사용해 장거리 의존성을 포착합니다.
가성비 앵커: V4-Flash는 6종 지수 작업 모두 호출당 $0.04 미만입니다. V4-Pro 출력 $0.87/M은 6월 영구 75% 인하 후 확정된 가격입니다.
DeepSeek V4 GA는 2026년 오픈소스 LLM 분야에서 가장 중요한 이정표 중 하나입니다. 폐쇄형 플래그십을 이기는 것이 아니라 극저비용으로 오픈소스 최강 성능을 제공하는 데 가치가 있습니다. 데이터 반출을 원치 않는 기업, 예산이 제한된 독립 개발자, 1M token 컨텍스트가 필요한 Agent 엔지니어에게 V4-Pro는 현재 가장 균형 잡힌 선택입니다.
로컬 또는 클라우드에서 V4-Flash를 자체 호스팅해 Agent 라우팅·추론 분기를 계획한다면 소비자용 Mac 16GB 메모리로는 부족합니다. ds4 로컬 추론 문서에 따르면 V4-Flash는 최소 96GB 통합 메모리가 필요합니다. 순수 API 호출은 하드웨어 문턱이 없지만, 고빈도 Agent 파이프라인은 호스트 안정성과 7×24 가동을 요구합니다. 자체 VPS는 Metal 가속이 없고 Swap 지터로 추론 타임아웃이 발생할 수 있으며, 단기 체험으로는 장문 컨텍스트 부하 테스트를 커버하기 어렵습니다. iOS CI/CD와 AI Agent 자동화에 더 적합한 안정적인 프로덕션 환경을 원한다면 MESHLAUNCH Mac Mini 클라우드 대여가 일반적으로 더 나은 선택입니다. Apple Silicon 단독 점유, 64GB+ 통합 메모리 온디맨드 업그레이드, 7×24 가동, 일·주·월 단위 유연 주문이 가능합니다.
평일 베이징 시간 09:00–12:00과 14:00–18:00이 피크이며 요율이 2배입니다. 대량 작업은 18:00 이후 실행을 권장합니다. 클라우드 추론 노드 방안은 대여 가격 페이지를 참고하십시오.
2026년 7월 24일 15:59 UTC(베이징 시간 23:59)에 영구 중단됩니다. deepseek-v4-flash 또는 deepseek-v4-pro로 마이그레이션해야 합니다.
Pro는 복잡한 추론·Agent에 적합합니다. Flash는 경량 라우팅에 적합하며 캐시 적중 입력은 $0.0028/M입니다. 로컬 배포 문턱은 고객 센터를 참고하십시오.
가장 어려운 벤치마크에서는 Fable 5가 여전히 앞섭니다. 그러나 V4-Pro SWE-bench Verified 80.6%는 오픈소스 최고이며, 출력가는 GPT-5.6 Sol의 약 1/17입니다.
가능합니다. V4는 OpenAI ChatCompletions와 Anthropic Messages 형식을 모두 지원합니다. base_url은 https://api.deepseek.com을 유지하고 model 파라미터만 업데이트하면 됩니다.