deepseek-chat を使っている方、GPT-5.6 / Claude Fable 5 とのコストパフォーマンス差を評価したい方、7 月 24 日の期限前に API 移行を完了したい方に向け、本稿では次の三点を整理します。① プレビュー版から GA までの完全タイムライン、② CSA+HCA アーキテクチャが 100 万 token コンテキストを支える仕組み、③ ベンチマークスコア・ピーク料金表・6 ステップ移行 Runbook です。
DeepSeek V4 GA で何がリリースされたか?プレビュー版からフル版までのタイムライン
2026 年 7 月 20 日、DeepSeek V4 フル版(General Availability)が正式にリリースされました。これはまったく新しいアーキテクチャではなく、4 月 24 日にオープンソース化された MoE 設計を踏襲したうえで、プレビュー版の安定性・性能最適化・商用課金体制が整った卒業版です。フル版では Agent 能力、数学推論、コード生成が重点的に強化され、正式な商用課金体系も整備されました。DeepSeek が「ほぼ無料」から規律ある商用運用へ移行する節目でもあります。
| 日付 | イベント |
|---|---|
| 2026-04-24 | V4 プレビュー版リリース + オープンソース(MIT)、V4-Pro(1.6T)と V4-Flash(284B)を含む |
| 2026-05 | V4-Flash と V4-Pro の本番チューニング版リリース、API 正式提供開始 |
| 2026-06 | V4-Pro 価格を恒久的に 75% 値下げ(出力 $0.87/M tokens) |
| 2026-06-29 | 全 API ユーザーへメール送信、7 月中旬 GA 予定とピーク・オフピーク課金を初公開 |
| 2026-07-19 | 複数の開発者が GA グレーンテスト資格を取得 |
| 2026-07-20 | GA 正式版リリース(本記事公開日) |
| 2026-07-24 | 旧インターフェース名 deepseek-chat と deepseek-reasoner が永久廃止 |
移行の緊急性:旧モデル名 deepseek-chat / deepseek-reasoner は 7 月 24 日 23:59(北京時間)に永久停止します。本番環境は 4 日以内に切り替えが必要です。
課金の複雑化:GA で初めてピーク・オフピークの差別料金が導入され、平日 09:00–12:00 と 14:00–18:00 はレートが 2 倍になります。24/7 パイプラインのスケジュール見直しが必要です。
性能期待の調整:フル版は Claude Fable 5 や GPT-5.6 Ultra を全面的に上回る段階ではありませんが、1/10 から 1/100 のコストでオープンソース最強クラスの性能を提供します。
セルフホストのハードル:MIT オープンソースですが、V4-Pro の 1.6T パラメータはローカルハードウェア要件が極めて高く、多くのチームは API またはクラウド上の高スペック Mac 推論ノードに依存します。
Kimi K3 との競合:Kimi K3 が 2.8T パラメータで規模記録を更新する中、DeepSeek はコストパフォーマンスと成熟した API エコシステムで開発者基盤を維持しています。
DeepSeek V4 アーキテクチャ解説とベンチマークスコア全表
DeepSeek V4 は V2/V3 時代の Multi-head Latent Attention(MLA)を廃止し、CSA(Compressed Sparse Attention)と HCA(Heavily Compressed Attention)のハイブリッドを採用しています。100 万 token シナリオでは KV Cache メモリが V3.2 の 10%(V4-Flash は 7% まで低減)、推論 FLOPs は V3.2 の 27% に抑えられます。mHC(Manifold-Constrained Hyper-Connections)は 4 チャネル残差ストリームで 61 層の深いネットワークを安定化し、学習には AdamW の代わりに Muon オプティマイザを採用しています。
| 仕様 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6 兆(1.6T) | 2840 億(284B) |
| トークンあたり活性化 | 490 億(49B) | 130 億(13B) |
| Transformer 層数 | 61 層 | 43 層 |
| コンテキストウィンドウ | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 精度 | FP4(エキスパート)+ FP8 | FP4 + FP8 混合 |
| 事前学習データ | 33T+ tokens | 32T+ tokens |
| オープンソースライセンス | MIT | MIT |
推論モードは 3 種類です。Non-think(最高速、思考チェーンなし)、Think High(明示的推論、コードデバッグ向き)、Think Max(最大推論強度、384K+ コンテキストが必要、複雑な数学と長チェーン Agent 向き)。公式推奨サンプリングパラメータは temperature=1.0, top_p=1.0 です。
| ベンチマーク | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(オープンソース最高) | 96.0% | 個別非公表 | 約 69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
Artificial Analysis のデータによると、Strategy & Ops タスクでは Claude Fable 5 が 1 回あたり $3.48(50 点)、DeepSeek V4-Pro は $0.03(38 点)——コストは 116 倍差、スコア差は約 12 点です。
DeepSeek V4 と GPT-5.6・Claude Fable 5 の比較:どう選ぶか
| 観点 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープンソース / セルフホスト | MIT 対応 | クローズド | クローズド |
| コンテキストウィンドウ | 1M tokens | 非公表 | 1M tokens |
| コード能力 | 極めて強い(Fable 5 に近い) | 極めて強い | 最強(SWE-bench Pro 80.3%) |
| API 出力価格(オフピーク) | $0.87/M | 約 $15/M | 約 $50/M |
| ピーク時出力価格 | $1.74/M | — | — |
| Agent 能力 | 強い、マルチ Agent オーケストレーション対応 | 強い | 最強 |
| データプライバシー | プライベート展開可 | 不可 | 不可 |
予算重視 / 高頻度呼び出し / プライベート展開 → V4-Pro または V4-Flash。究極のコード能力、コスト不問 → Claude Fable 5。複雑なアルゴリズム + 数学推論 → GPT-5.6 Sol / Ultra。超大規模ログ・文書処理 → V4-Flash(キャッシュヒット入力は $0.0028/M のみ)。
ピーク・オフピーク課金でコストを抑える方法と API 移行 6 ステップ Runbook(7/24 期限)
| モデル | 課金項目 | オフピーク | ピーク |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | ¥0.025 / $0.0035 / 1M | 2 倍 |
| 入力(キャッシュミス) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 出力 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 入力(キャッシュヒット) | ¥0.02 / $0.0028 / 1M | 2 倍 |
| 入力(キャッシュミス) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 出力 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
ピーク時間帯(北京時間):平日 09:00–12:00 と 14:00–18:00 です。ピーク時でも V4-Pro の出力価格($1.74/M)は Claude Opus 4.8($15/M)より 8.6 倍安いです。
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
期限警告:deepseek-chat → deepseek-v4-flash(非思考モード);deepseek-reasoner → deepseek-v4-flash(思考モード)または deepseek-v4-pro。7 月 24 日 15:59 UTC 以降は永久に利用できません。
旧モデル名を全庫検索:コードベースで deepseek-chat と deepseek-reasoner を検索し、環境変数と設定ファイルも含めて洗い出します。
移行マッピングを確定:軽量対話 → deepseek-v4-flash、複雑な推論 → deepseek-v4-pro + thinking パラメータ。
Staging 環境で検証:ステージングでモデル名を切り替え、回帰テストスイートで出力品質の劣化がないか確認します。
Prompt Cache を設定:固定 System Prompt をメッセージ先頭に配置し、キャッシュヒット率を最大化します(Flash ヒット時は $0.0028/M)。
非リアルタイムタスクをスケジュール:バッチ文書処理やコードレビューは 18:00 以降または 09:00 前に実行し、ピーク時間帯を避けます。
本番グレーンデプロイ:7 月 23 日までに全量切り替えを完了し、24 時間のロールバック窓を確保します。DeepSeek の課金変更メール通知も注視してください。
DeepSeek V4 フル版はアップグレードに値するか?引用可能なハードデータ
CSA 圧縮比:KV シーケンスを Softmax ゲート付きプーリングで 4 倍圧縮。V4-Pro は top-1024 / V4-Flash は top-512 のスパース選択 + 128 token スライディングウィンドウ。
HCA グローバルアテンション:トークンを 128 倍圧縮したうえでグローバル密アテンションを実行し、CSA と交互に使用して長距離依存を捉えます。
コストパフォーマンス基準点:V4-Flash は 6 カテゴリの指数タスクすべてで 1 回あたり $0.04 未満。V4-Pro の出力 $0.87/M は 6 月の恒久 75% 値下げ後の確定価格です。
DeepSeek V4 GA は 2026 年オープンソース LLM 分野における最重要マイルストーンの一つです。その価値はクローズドソース旗艦を打ち負かすことではなく、極めて低いコストでオープンソース最強クラスの性能を提供することにあります。データを国外に出したくない企業、予算の限られた個人開発者、100 万 token コンテキストを必要とする Agent エンジニアにとって、V4-Pro は現時点で最もバランスの取れた選択肢です。
V4-Flash をローカルまたはクラウドでセルフホストし、Agent ルーティングと推論分流を行う計画がある場合、コンシューマー向け Mac の 16GB メモリはまったく足りません——ds4 ローカル推論 ドキュメントによると、V4-Flash には少なくとも 96GB のユニファイドメモリが必要です。純粋な API 呼び出しにはハードウェアのハードルはありませんが、高頻度 Agent パイプラインにはホストの安定性と 7×24 稼働が求められます。自前 VPS には Metal 加速がなく、Swap のジッターが推論タイムアウトを引き起こすことがあります。短期トライアルでは長コンテキスト負荷テストをカバーしきれません。iOS CI/CD と AI Agent 自動化により適した安定した本番環境には、MESHLAUNCH の Mac Mini クラウドレンタルが通常はより優れた選択です。専有 Apple Silicon、64GB+ ユニファイドメモリへのオンデマンド拡張、7×24 オンライン、日/週/月の柔軟な契約が可能です。
平日の北京時間 09:00–12:00 と 14:00–18:00 がピーク時間帯で、レートは 2 倍になります。バッチタスクは 18:00 以降の実行を推奨します。クラウド推論ノードの詳細は レンタル料金ページ をご覧ください。
2026 年 7 月 24 日 15:59 UTC(北京時間 23:59)に永久廃止されます。deepseek-v4-flash または deepseek-v4-pro へ移行してください。
Pro は複雑な推論と Agent 向き、Flash は軽量ルーティング向きで、キャッシュヒット入力は $0.0028/M のみです。ローカル展開のハードルは ヘルプセンター を参照してください。
最難ベンチマークでは Fable 5 が依然としてリードしています。ただし V4-Pro の SWE-bench Verified 80.6% はオープンソース記録で、出力価格は GPT-5.6 Sol の約 1/17 です。
可能です。V4 は OpenAI ChatCompletions と Anthropic Messages 形式の両方に対応しています。base_url は https://api.deepseek.com のまま、model パラメータのみ更新すれば動作します。