DeepSeek V4 Flash 정식판 출시
점수는 Opus 4.8에 근접, 가격은 수십 분의 일

7/31 정식판 · 사후 학습 역전 · Harness 첫 등장 · 육각 비교 · 가격 파괴선 · 6단계 Runbook

DeepSeek V4 Flash 0731 정식판 리뷰 2026
7월 31일 DeepSeek이 V4-Flash를 정식판 0731로 업그레이드했습니다. 파라미터 규모는 그대로이고 사후 학습만 재실행했지만, 여러 Agent 벤치마크에서 자사의 더 큰 V4-Pro 프리뷰를 역전했으며 API 가격은 Claude Opus 4.8의 수십 분의 일입니다. 플래그십 V4-Pro 정식판과 자체 Agent 프레임워크 Harness 출시 시점, 벤치마크 신뢰성, Kimi K3 / Qwen3.8-Max와의 횡단 비교가 궁금하다면 본문에서 ① 4월 프리뷰부터 7월 「정식판」까지의 전체 타임라인, ② 요금과 Artificial Analysis 제3자 지수 대조, ③ 사후 학습이 성능을 끌어올린 방식과 6단계 연결 Runbook을 정리합니다.
01

DeepSeek V4 Flash 정식판에서 무엇이 공개되었나? 4월 프리뷰부터 7월 정식판까지 타임라인

이번 업데이트는 새 모델 출시가 아니라, 총 284B / 활성화 13B Flash 버전에 사후 학습을 다시 돌린 것입니다. 진정한 플래그십 V4-Pro 정식판과 DeepSeek 최초의 자체 Agent 프레임워크 Harness는 모두 「곧 공개」 상태이며 확정 일정은 없습니다.

01

「신모델」 오해: 7/31 업그레이드는 파라미터 확대가 아닙니다. 공식은 성능 향상이 전적으로 사후 학습 재실행에서 왔다고 명시했으며, 「크면 강하다」는 업계 직관과 반대 결과입니다.

02

API와 소비자 제품 분리: 정식판은 API 베타 한정이며 앱과 웹은 아직 동기화되지 않았습니다. 클라이언트만 보는 사용자는 「아직 업데이트 안 됨」으로 오해하기 쉽습니다.

03

구 API 폐지: 7월 24일 deepseek-chat / deepseek-reasoner가 공식 중단되어, 마이그레이션하지 않은 파이프라인은 404가 됩니다.

04

경쟁 창 압박: 7월 27일 Kimi K3(2.8T) 오픈 가중치가 공개되어 Flash 정식판에 직접적인 벤치마크 압력을 가했습니다.

05

Pro판 「공언」 리스크: 커뮤니티에서는 조롱도 있었으나 Flash 초과 기대로 분위기가 반전되었습니다. V4-Pro GA 공식 일정은 여전히 없습니다.

시점이벤트
2026-04-24V4 프리뷰 오픈소스: V4-Pro(1.6T/49B)와 V4-Flash(284B/13B), 모두 1M 컨텍스트, MIT 라이선스
2026-07-24구 모델명 폐지, 트래픽을 V4 시리즈 명명으로 전환
2026-07-27Kimi K3 2.8T 가중치 Hugging Face 공개
2026-07-31V4-Flash-0731 정식판 API 베타 및 가중치 동기화, changelog에서 Harness 「곧 공개」 최초 언급
2026-08-05 기준V4-Pro 정식판은 여전히 「곧 공개」, 언론이 전한 8/10–8/20 GA 창은 공식 미확인
02

DeepSeek V4 Flash 요금은 얼마인가? Kimi K3, Qwen3.8-Max 핵심 데이터 비교

모델상태총/활성 파라미터컨텍스트입력가(미스/히트, $/1M)출력($/1M)라이선스
V4-Flash-0731정식판(7/31)284B / 13B1M$0.14 / $0.0028$0.28MIT
V4-Pro프리뷰1.6T / 49B1M$0.435 / $0.003625$0.87MIT
Kimi K3가중치 공개(7/27)2.8T / 약 104B약 1.05M$3.00 / $0.30$15.00Modified MIT
GLM-5.2오픈소스(6월)약 744B / 약 40B1M본문 미확인본문 미확인MIT
Qwen3.8-MaxAPI GA(8/2)2.4T / 95B1M$2.00 / 약 $0.17–0.25$6.00오픈소스 예정

위 요금은 모두 벤더 공개 데이터입니다. DeepSeek은 베이징 시간 피크대(9–12시, 14–18시)에 API 2배 요금을 적용할 예정이라고 예고했으나, 작성 시점에는 시행일이 발표되지 않았습니다. 7월 20일 V4 GA 해설과 달리 본문은 7/31 Flash 정식판과 Harness 첫 등장에 집중합니다.

Flash 정식판 대 Claude Opus 4.8: 캐시 미스 입력 약 36배 저렴, 캐시 히트 약 179배, 출력 약 89배 저렴합니다. 모두 벤더 표시가이며 독립 감사가 아닙니다.

03

성능은 어떻게 「끌어올렸나」? 사후 학습, CSA+HCA, Harness Agent 프레임워크

V4-Flash-0731은 파라미터 규모와 구조가 4월 프리뷰와 완전히 동일하며, 공식은 향상이 사후 학습 재실행에서 왔다고 설명합니다. 284B/13B Flash가 여러 Agent 벤치마크에서 1.6T/49B V4-Pro 프리뷰를 역전한 사실은 2026년 하반기 경쟁 초점이 「파라미터 적층」에서 「사후 학습 품질」로 이동하고 있음을 보여줍니다.

01

하이브리드 어텐션 CSA+HCA: 압축 희소 어텐션과 고도 압축 어텐션 조합으로, 대외적으로 DSA라 불리며 장문 컨텍스트 연산과 VRAM을 줄입니다.

02

mHC 초연결: 다양체 제약 초연결로 잔차 구조를 개선해 깊은 층의 안정성을 높입니다.

03

Muon 옵티마이저: 기존 옵티마이저를 대체해 수렴을 가속합니다. 공식은 100만 token에서 V4-Pro FLOPs가 V3.2의 27%, KV Cache가 10%라고 밝혔습니다.

7월 31일 changelog에 DeepSeek Harness가 처음 공식 등장했습니다. Claude Code에 대응하는 자체 Agent 실행 프레임워크로, 파일 읽기·쓰기, 도구 호출, 엔드투엔드 엔지니어링 작업용입니다. 공식이 공개한 Terminal Bench 2.0, Toolathlon 등 Agent 점수는 모두 Harness 미니멀 모드에서 측정되었으며, 프레임워크 자체는 아직 공개되지 않았습니다. changelog 원문은 점수가 harness 선택에 매우 민감하며 모델 단독 능력 향상과 단순 동일시할 수 없다고 말합니다.

참고: Terminal Bench 2.0 공식 보고에서 Flash-0731은 82.7, V4-Pro 프리뷰는 67.9입니다. 파라미터는 max 설정, top_p=0.95, temperature=1.0이며, 벤더 자보 및 특정 프레임워크 결과입니다.

04

중국 오픈소스 LLM 육각 비교: Artificial Analysis 지수와 6단계 연결 Runbook

모델Intelligence Index태스크 단가(AA)비고
V4-Flash-0731DeepSeek50$0.03정식판 7/31
Kimi K3월之暗面57$0.86지수는 높으나 비용 약 29배
GLM-5.2智谱약 1점 높음본문 미확인6월 오픈소스
GPT-5.6 SolOpenAI9점 이상 높음$1.86폐쇄형
Claude Fable 5Anthropic9점 이상 높음$3.15폐쇄형

Intelligence Index와 태스크 단가는 Artificial Analysis(제3자)를 경제 언론이 인용한 수치입니다. DeepSeek 자보 Agent 점수는 방법론이 달라 단순 합산 비교는 피해야 합니다. DeepSeek이 노리는 것은 「점수 1위」가 아니라 「충분한 지능 + 극한 가격」입니다. 프리뷰는 OpenRouter 호출량 1위를 7주 연속 유지한 바 있습니다.

01

연결 지점 확인: modeldeepseek-v4-flash로 설정하고 base_urlhttps://api.deepseek.com 유지. OpenAI/Anthropic SDK 형식 모두 사용 가능합니다.

02

구 모델명 정리: 코드베이스 전체에서 deepseek-chat, deepseek-reasoner를 검색하고 CI 환경 변수와 설정 파일도 포함합니다.

03

스테이징 회귀: 프리프로덕션에서 모델명을 전환하고 Agent 파이프라인 출력 품질과 지연을 비교하며 캐시 히트율을 기록합니다.

04

Prompt Cache 최적화: System Prompt를 상단에 고정해 캐시 히트($0.0028/M 입력)를 극대화합니다.

05

계층 라우팅: 경량 라우팅과 배치 작업은 Flash, 복잡한 추론은 임시로 V4-Pro 프리뷰, 정식판 출시 후 재평가합니다.

06

Harness 공개 모니터링: 공식 changelog와 Hugging Face 가중치 업데이트를 추적합니다. Agent 점수는 Harness 공개 후 독립 재현합니다.

05

벤치마크 논쟁, 가격 파괴선, 인용 가능한 하드 데이터: Pro판은 언제 오나?

A

Harness 의존: Agent 계열 점수는 벤더 자보이며 미공개 프레임워크 기반이므로 Claude Code/Cursor 등 독립 재현을 기다리는 것이 좋습니다.

B

가용성 격차: 해외 커뮤니티에서는 캐시 히트율 저하와 안전 분류기 타임아웃이 보고되며, 연산력과 엔지니어링 세부가 상한을 제한합니다.

C

「가격 파괴선」: 중국어권 개발자 커뮤니티 용어로, 「충분한 성능 + 극단적 저가」 조합이 경쟁사에 명확한 차별화나 추가 인하를 강요하는 상황을 가리킵니다. GPT-5.6 Luna 80% 인하 등도 이 맥락과 관련됩니다.

7월 31일 AI 칩 주가는 크게 움직이지 않았습니다. 시장은 「DeepSeek식 효율 돌파」에 익숙해졌으며, 2025년 초 R1 발표 때 칩주 급락과 대조적입니다. 여러 언론이 DeepSeek 약 74억 달러 조달과 IPO 준비를 보도했으나, 현재는 「보도 기반」이며 규제 서류로 직접 확인되지 않아 배경 정보로 다루는 것이 적절합니다.

로컬에서 ds4로 V4-Flash를 실행하려면 96GB 통합 메모리가 실질 하한입니다. 순수 API 호출에는 하드웨어 문턱이 없지만, 고빈도 Agent 파이프라인에는 7×24 안정 호스트가 필요합니다. 소비자용 Mac이나 저사양 VPS에서는 Swap 지터와 추론 타임아웃이 발생하기 쉽고, 단기 체험으로는 100만 token 부하 테스트를 커버하기 어렵습니다. iOS CI/CD와 AI Agent 자동화에 더 적합한 안정적 프로덕션 환경에는 MESHLAUNCH Mac Mini 클라우드 대여가 일반적으로 최적의 선택입니다. Apple Silicon 단독 점유, 통합 메모리 온디맨드 증설, 일·주·월 유연 주문을 지원합니다.

FAQ

네이티브 1M 컨텍스트를 지원합니다. 100만 token에서 V4-Pro FLOPs는 V3.2의 27%, KV Cache는 10%입니다. Agent 최적화와 Claude Code, OpenCode 적합. 요금 비교는 대여 가격 페이지를 참고하세요.

대규모 저비용 호출, 배치 처리, Agent 파이프라인에는 V4-Flash-0731을 우선합니다. 더 깊은 추론이 필요하고 예산이 여유 있다면 V4-Pro 프리뷰를 임시 사용하세요.

2026-08-05 기준으로는 불가합니다. 정식판은 V4-Flash-0731만 API로 제공됩니다. 8/10–8/20 GA는 미확인 루머입니다. 배포 문의는 고객센터를 참고하세요.

SWE-bench Verified 등 제3자 벤치마크는 신뢰도가 높습니다. Terminal Bench 2.0은 미공개 Harness 기반이며 공식도 프레임워크 민감도를 밝혔으므로 커뮤니티 재현을 기다리는 것이 좋습니다.

OpenAI/Anthropic 형식 그대로 연결할 수 있으며, deepseek-v4-flash는 새 정식판을 자동 참조합니다. 폐지된 구 모델명은 빠르게 전환해야 합니다.