DeepSeek V4 フル版正式リリース
料金・アーキテクチャ・GPT-5.6 比較 完全解説

タイムライン · CSA+HCA アーキテクチャ · ベンチマーク全表 · ピーク課金 · API 移行 · 7/24 期限

DeepSeek V4 フル版 GA 正式リリース 2026
3 か月の待機を経て、DeepSeek V4 フル版(GA 正式版)が 2026 年 7 月 20 日に正式リリースされました。4 月のプレビュー版と比べ、正式版では Agent 能力・数学推論・コード生成が重点的に強化され、初めてピーク・オフピーク課金が導入されています。いまだに deepseek-chat を使っている方、GPT-5.6 / Claude Fable 5 とのコストパフォーマンス差を評価したい方、7 月 24 日の期限前に API 移行を完了したい方に向け、本稿では次の三点を整理します。① プレビュー版から GA までの完全タイムライン、② CSA+HCA アーキテクチャが 100 万 token コンテキストを支える仕組み、③ ベンチマークスコア・ピーク料金表・6 ステップ移行 Runbook です。
01

DeepSeek V4 GA で何がリリースされたか?プレビュー版からフル版までのタイムライン

2026 年 7 月 20 日、DeepSeek V4 フル版(General Availability)が正式にリリースされました。これはまったく新しいアーキテクチャではなく、4 月 24 日にオープンソース化された MoE 設計を踏襲したうえで、プレビュー版の安定性・性能最適化・商用課金体制が整った卒業版です。フル版では Agent 能力、数学推論、コード生成が重点的に強化され、正式な商用課金体系も整備されました。DeepSeek が「ほぼ無料」から規律ある商用運用へ移行する節目でもあります。

日付イベント
2026-04-24V4 プレビュー版リリース + オープンソース(MIT)、V4-Pro(1.6T)と V4-Flash(284B)を含む
2026-05V4-Flash と V4-Pro の本番チューニング版リリース、API 正式提供開始
2026-06V4-Pro 価格を恒久的に 75% 値下げ(出力 $0.87/M tokens)
2026-06-29全 API ユーザーへメール送信、7 月中旬 GA 予定とピーク・オフピーク課金を初公開
2026-07-19複数の開発者が GA グレーンテスト資格を取得
2026-07-20GA 正式版リリース(本記事公開日)
2026-07-24旧インターフェース名 deepseek-chatdeepseek-reasoner が永久廃止
01

移行の緊急性:旧モデル名 deepseek-chat / deepseek-reasoner7 月 24 日 23:59(北京時間)に永久停止します。本番環境は 4 日以内に切り替えが必要です。

02

課金の複雑化:GA で初めてピーク・オフピークの差別料金が導入され、平日 09:00–12:00 と 14:00–18:00 はレートが 2 倍になります。24/7 パイプラインのスケジュール見直しが必要です。

03

性能期待の調整:フル版は Claude Fable 5 や GPT-5.6 Ultra を全面的に上回る段階ではありませんが、1/10 から 1/100 のコストでオープンソース最強クラスの性能を提供します。

04

セルフホストのハードル:MIT オープンソースですが、V4-Pro の 1.6T パラメータはローカルハードウェア要件が極めて高く、多くのチームは API またはクラウド上の高スペック Mac 推論ノードに依存します。

05

Kimi K3 との競合:Kimi K3 が 2.8T パラメータで規模記録を更新する中、DeepSeek はコストパフォーマンスと成熟した API エコシステムで開発者基盤を維持しています。

02

DeepSeek V4 アーキテクチャ解説とベンチマークスコア全表

DeepSeek V4 は V2/V3 時代の Multi-head Latent Attention(MLA)を廃止し、CSA(Compressed Sparse Attention)と HCA(Heavily Compressed Attention)のハイブリッドを採用しています。100 万 token シナリオでは KV Cache メモリが V3.2 の 10%(V4-Flash は 7% まで低減)、推論 FLOPs は V3.2 の 27% に抑えられます。mHC(Manifold-Constrained Hyper-Connections)は 4 チャネル残差ストリームで 61 層の深いネットワークを安定化し、学習には AdamW の代わりに Muon オプティマイザを採用しています。

仕様V4-ProV4-Flash
総パラメータ数1.6 兆(1.6T)2840 億(284B)
トークンあたり活性化490 億(49B)130 億(13B)
Transformer 層数61 層43 層
コンテキストウィンドウ1,000,000 tokens1,000,000 tokens
最大出力384K tokens384K tokens
精度FP4(エキスパート)+ FP8FP4 + FP8 混合
事前学習データ33T+ tokens32T+ tokens
オープンソースライセンスMITMIT

推論モードは 3 種類です。Non-think(最高速、思考チェーンなし)、Think High(明示的推論、コードデバッグ向き)、Think Max(最大推論強度、384K+ コンテキストが必要、複雑な数学と長チェーン Agent 向き)。公式推奨サンプリングパラメータは temperature=1.0, top_p=1.0 です。

ベンチマークDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6%(オープンソース最高)96.0%個別非公表約 69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

Artificial Analysis のデータによると、Strategy & Ops タスクでは Claude Fable 5 が 1 回あたり $3.48(50 点)、DeepSeek V4-Pro は $0.03(38 点)——コストは 116 倍差、スコア差は約 12 点です。

03

DeepSeek V4 と GPT-5.6・Claude Fable 5 の比較:どう選ぶか

観点DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
オープンソース / セルフホストMIT 対応クローズドクローズド
コンテキストウィンドウ1M tokens非公表1M tokens
コード能力極めて強い(Fable 5 に近い)極めて強い最強(SWE-bench Pro 80.3%)
API 出力価格(オフピーク)$0.87/M約 $15/M約 $50/M
ピーク時出力価格$1.74/M
Agent 能力強い、マルチ Agent オーケストレーション対応強い最強
データプライバシープライベート展開可不可不可

予算重視 / 高頻度呼び出し / プライベート展開 → V4-Pro または V4-Flash。究極のコード能力、コスト不問 → Claude Fable 5。複雑なアルゴリズム + 数学推論 → GPT-5.6 Sol / Ultra。超大規模ログ・文書処理 → V4-Flash(キャッシュヒット入力は $0.0028/M のみ)。

04

ピーク・オフピーク課金でコストを抑える方法と API 移行 6 ステップ Runbook(7/24 期限)

モデル課金項目オフピークピーク
V4-Pro入力(キャッシュヒット)¥0.025 / $0.0035 / 1M2 倍
入力(キャッシュミス)¥3.00 / $0.435 / 1M¥6.00 / $0.87
出力¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash入力(キャッシュヒット)¥0.02 / $0.0028 / 1M2 倍
入力(キャッシュミス)¥1.00 / $0.14 / 1M¥2.00 / $0.28
出力¥2.00 / $0.28 / 1M¥4.00 / $0.56

ピーク時間帯(北京時間):平日 09:00–12:0014:00–18:00 です。ピーク時でも V4-Pro の出力価格($1.74/M)は Claude Opus 4.8($15/M)より 8.6 倍安いです。

Python
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

期限警告:deepseek-chatdeepseek-v4-flash(非思考モード);deepseek-reasonerdeepseek-v4-flash(思考モード)または deepseek-v4-pro。7 月 24 日 15:59 UTC 以降は永久に利用できません。

01

旧モデル名を全庫検索:コードベースで deepseek-chatdeepseek-reasoner を検索し、環境変数と設定ファイルも含めて洗い出します。

02

移行マッピングを確定:軽量対話 → deepseek-v4-flash、複雑な推論 → deepseek-v4-pro + thinking パラメータ。

03

Staging 環境で検証:ステージングでモデル名を切り替え、回帰テストスイートで出力品質の劣化がないか確認します。

04

Prompt Cache を設定:固定 System Prompt をメッセージ先頭に配置し、キャッシュヒット率を最大化します(Flash ヒット時は $0.0028/M)。

05

非リアルタイムタスクをスケジュール:バッチ文書処理やコードレビューは 18:00 以降または 09:00 前に実行し、ピーク時間帯を避けます。

06

本番グレーンデプロイ:7 月 23 日までに全量切り替えを完了し、24 時間のロールバック窓を確保します。DeepSeek の課金変更メール通知も注視してください。

05

DeepSeek V4 フル版はアップグレードに値するか?引用可能なハードデータ

A

CSA 圧縮比:KV シーケンスを Softmax ゲート付きプーリングで 4 倍圧縮。V4-Pro は top-1024 / V4-Flash は top-512 のスパース選択 + 128 token スライディングウィンドウ。

B

HCA グローバルアテンション:トークンを 128 倍圧縮したうえでグローバル密アテンションを実行し、CSA と交互に使用して長距離依存を捉えます。

C

コストパフォーマンス基準点:V4-Flash は 6 カテゴリの指数タスクすべてで 1 回あたり $0.04 未満。V4-Pro の出力 $0.87/M は 6 月の恒久 75% 値下げ後の確定価格です。

DeepSeek V4 GA は 2026 年オープンソース LLM 分野における最重要マイルストーンの一つです。その価値はクローズドソース旗艦を打ち負かすことではなく、極めて低いコストでオープンソース最強クラスの性能を提供することにあります。データを国外に出したくない企業、予算の限られた個人開発者、100 万 token コンテキストを必要とする Agent エンジニアにとって、V4-Pro は現時点で最もバランスの取れた選択肢です。

V4-Flash をローカルまたはクラウドでセルフホストし、Agent ルーティングと推論分流を行う計画がある場合、コンシューマー向け Mac の 16GB メモリはまったく足りません——ds4 ローカル推論 ドキュメントによると、V4-Flash には少なくとも 96GB のユニファイドメモリが必要です。純粋な API 呼び出しにはハードウェアのハードルはありませんが、高頻度 Agent パイプラインにはホストの安定性と 7×24 稼働が求められます。自前 VPS には Metal 加速がなく、Swap のジッターが推論タイムアウトを引き起こすことがあります。短期トライアルでは長コンテキスト負荷テストをカバーしきれません。iOS CI/CD と AI Agent 自動化により適した安定した本番環境には、MESHLAUNCH の Mac Mini クラウドレンタルが通常はより優れた選択です。専有 Apple Silicon、64GB+ ユニファイドメモリへのオンデマンド拡張、7×24 オンライン、日/週/月の柔軟な契約が可能です。

よくある質問

平日の北京時間 09:00–12:00 と 14:00–18:00 がピーク時間帯で、レートは 2 倍になります。バッチタスクは 18:00 以降の実行を推奨します。クラウド推論ノードの詳細は レンタル料金ページ をご覧ください。

2026 年 7 月 24 日 15:59 UTC(北京時間 23:59)に永久廃止されます。deepseek-v4-flash または deepseek-v4-pro へ移行してください。

Pro は複雑な推論と Agent 向き、Flash は軽量ルーティング向きで、キャッシュヒット入力は $0.0028/M のみです。ローカル展開のハードルは ヘルプセンター を参照してください。

最難ベンチマークでは Fable 5 が依然としてリードしています。ただし V4-Pro の SWE-bench Verified 80.6% はオープンソース記録で、出力価格は GPT-5.6 Sol の約 1/17 です。

可能です。V4 は OpenAI ChatCompletions と Anthropic Messages 形式の両方に対応しています。base_urlhttps://api.deepseek.com のまま、model パラメータのみ更新すれば動作します。