DeepSeek V4 満血版正式リリース:料金・架構と GPT-5.6 との性能差を徹底解説

3か月の待機を経て、DeepSeek V4 満血版(GA 正式版)が 2026 年 7 月 20 日に本番稼働を開始しました。Agent 能力が全面強化され、初めてピーク・オフピークの差別料金が導入されたことで、DeepSeek は「ほぼ無料」から規律ある商用運用へと移行したと言えます。

結論: DeepSeek V4 GA は MIT オープンソース + 100万トークンコンテキスト + SWE-bench Verified 80.6% のオープンソース記録により、クローズド旗艦の 1/10 から 1/100 のコストでオープンソース最強クラスの性能を提供します。本記事ではタイムライン、技術架構(CSA/HCA/mHC/Muon)、ベンチマーク、GPT-5.6 / Claude Fable 5 との比較、ピーク・オフピーク料金、7月24日 API 移行の6つの観点から整理し、6ステップ Runbook と FAQ も掲載します。プライベートデプロイが必要な場合は、当サイトの ds4 高メモリ Mac クラウド推論ガイドを参照してください。

00DeepSeek V4 満血版とは?

DeepSeek V4 満血版(GA、General Availability)は、DeepSeek が 2026 年 7 月 20 日に正式リリースした本番向け大規模言語モデルファミリーです。V4-Pro(1.6T パラメータ)V4-Flash(284B パラメータ)の2規格が含まれ、いずれも MIT ライセンスでオープンソース化され、100万トークンのコンテキストと最大 384K トークンの出力に対応しています。

4月のプレビュー版と比べ、GA 版では Agent タスク、数学推論、コード生成が重点的に強化され、正式な商用課金体系——ピーク・オフピークの差別料金——が整備されました。旧インターフェース名 deepseek-chatdeepseek-reasoner7月24日に永久停止します。

  • オープンソースでセルフホスト可能:MIT ライセンスにより、企業はデータ越境コンプライアンスを満たすプライベートデプロイが可能です。
  • 100万トークンコンテキストが実用レベル:KV キャッシュのメモリ使用量は V3.2 の 10%(Flash は 7%)に抑えられています。
  • オープンソース SWE-bench 記録:Verified で 80.6%、Gemini 3.1 Pro と並ぶオープンソース最高水準です。
  • API コストパフォーマンス:V4-Pro の出力はオフピーク $0.87/M、ピーク $1.74/M で、Claude Fable 5 の約 1/57 です。

01タイムライン:プレビュー版から満血版へ

日付イベント
2026-04-24V4 プレビュー版リリース + オープンソース(MIT)。V4-Pro(1.6T)と V4-Flash(284B)を含む
2026-05本番チューニング版リリース、API 正式利用開始
2026-06V4-Pro 価格を恒久的に 75% 値下げ(出力 $0.87/M トークン)
2026-06-29全 API ユーザーへメール送信。7月中旬の GA リリースとピーク・オフピーク料金を初公開
2026-07-19複数の開発者が GA グレー内測資格を取得。メディアは「満血版は最短で翌日リリース」と報道
2026-07-20GA 正式版リリース(本記事公開日)
2026-07-24旧インターフェース deepseek-chat / deepseek-reasoner 永久停止
主な変化: プレビュー版でも十分強力でしたが、満血版では Agent・数学・コード能力がさらに向上し、ピーク・オフピーク料金と旧インターフェース廃止スケジュールが明確化されました。V4-Pro の 75% 値下げについては、当サイトの 6月 AI 値下げまとめを参照してください。

02技術架構の詳細解説

モデルファミリー一覧

仕様V4-ProV4-Flash
総パラメータ数1.6 兆(1.6T)2840 億(284B)
トークンあたり活性パラメータ490 億(49B)130 億(13B)
Transformer 層数61 層43 層
コンテキストウィンドウ1,000,000 トークン1,000,000 トークン
最大出力384K トークン384K トークン
精度FP4(エキスパート重み)+ FP8(その他)FP4 + FP8 混合
事前学習データ量33T+ トークン32T+ トークン
オープンソースライセンスMITMIT

ハイブリッドアテンション機構(CSA + HCA)

DeepSeek V4 は V2/V3 時代の MLA を廃止し、2種類の新アテンション機構のハイブリッドを採用しています。

圧縮スパースアテンション(CSA):KV シーケンスを Softmax ゲート付きプーリングで 4 倍に圧縮し、FP4「ライトニングインデクサー」で top-k スパース選択(Pro は top-1024、Flash は top-512)を行います。同時に直近 128 トークンのスライディングウィンドウを保持します。100万トークンコンテキストでは V3.2 比で推論 FLOPs は 27%に抑えられます。

高密度圧縮アテンション(HCA):トークンを 128 倍に圧縮したうえでグローバル密集アテンションを行い、長距離依存を捉えます。Flash は最初の 2 層で HCA を使用し、その後 CSA/HCA を交互に配置します。Pro も同様の構造です。

総合効果:100万トークンシナリオでは KV キャッシュのメモリは V3.2 の 10%(Flash は 7%)にまで削減されます。

多様体制約ハイパーコネクション(mHC)と Muon オプティマイザ

mHC は従来の残差接続を拡張し、4 チャネルの残差ストリームと双確率行列制約(Birkhoff 多面体)を導入することで、61 層の深いネットワークでも信号が安定して伝播します。Muon オプティマイザはニュートン・シュルツ直交化で勾配を処理し、収束が速く、訓練が安定します。

3つの推論モード

モード特徴適用シナリオ
Non-think思考チェーンなし、高速応答単純な Q&A、ルーティング振り分け
Think High明示的推論(<redacted_thinking> タグ)中程度の複雑タスク、コードデバッグ
Think Max最大推論強度、384K+ コンテキストが必要複雑な数学、長チェーン Agent

公式推奨サンプリングパラメータ:temperature=1.0, top_p=1.0(全モード共通)。

03ベンチマーク:オープンソース王者の成績表

ベンチマークDeepSeek V4-ProClaude Fable 5GPT-5.6 UltraClaude Opus 4.8
SWE-bench Verified80.6%(オープンソース最高)96.0%個別未公表約 69%
SWE-bench Pro55.4%80.3%78.1%69.2%
LiveCodeBench (Pass@1)93.5%88.1%87.4%83.2%
Codeforces Elo3,206
Terminal-Bench 2.183.9%88.0%85.1%82.7%

SWE-bench Verified は実際の GitHub リポジトリでのバグ修正を測定するテストで、80.6% は現時点のオープンソースモデル最高記録です。より厳格な SWE-bench Pro では Claude Fable 5 が 80.3% でリードしています。

コストパフォーマンス横断比較

Artificial Analysis の評価データ(Strategy & Ops 指数タスク):

  • Claude Fable 5:1回あたり $3.48、スコア 50 点
  • DeepSeek V4-Pro:1回あたり $0.03、スコア 38 点
  • DeepSeek V4-Flash:6種類の指数タスクいずれも 1回あたり $0.04 未満

Fable 5 のコストは V4-Pro の 116 倍ですが、スコアは約 12 点(31%)しか上回りません。Kimi K3 レビューと照らすと、K3 はパラメータ規模こそ大きいものの API 出力は $15/M であり、コスト重視のシナリオでは V4-Pro が依然として圧倒的な優位性を持ちます。

04GPT-5.6 / Claude Fable 5 との全面比較

観点DeepSeek V4-ProGPT-5.6 SolClaude Fable 5
オープンソースMIT ライセンスクローズドクローズド
セルフホスト対応非対応非対応
コンテキストウィンドウ100万トークン未公開100万トークン
コード能力極めて強力(Fable 5 に接近)極めて強力最強
API 出力価格(オフピーク)$0.87/M トークン約 $15/M$50/M
ピーク出力価格$1.74/M トークン
Agent 能力強力、マルチ Agent オーケストレーション対応強力最強
データプライバシープライベートデプロイ可能非対応非対応

選定の指針:

  • 予算制約・高頻度呼び出し・プライベートデプロイ:V4-Pro または V4-Flash を第一候補に
  • 究極のコード能力、コスト不問:Claude Fable 5(SWE-bench Pro 最高スコア)
  • 複雑なアルゴリズム + 数学推論:GPT-5.6 Sol / Ultra
  • 超大規模ログ・文書処理:V4-Flash(キャッシュヒット入力は $0.0028/M のみ)

05ピーク・オフピーク料金の詳細:コスト最適化の方法

GA 版で最も注目された変化は、DeepSeek が初めてピーク・オフピークの差別料金を導入したことです。電力の時間帯別料金に似た仕組みです。ピーク時間帯(北京時間)は平日 09:00–12:00 と 14:00–18:00 で、料金は2倍になります。

モデル課金項目オフピークピーク
V4-Pro入力(キャッシュヒット)¥0.025 / $0.0035 / 1M2倍
入力(キャッシュミス)¥3.00 / $0.435 / 1M¥6.00 / $0.87
出力¥6.00 / $0.87 / 1M¥12.00 / $1.74
V4-Flash入力(キャッシュヒット)¥0.02 / $0.0028 / 1M2倍
入力(キャッシュミス)¥1.00 / $0.14 / 1M¥2.00 / $0.28
出力¥2.00 / $0.28 / 1M¥4.00 / $0.56

コスト削減の4つの施策:

  1. リアルタイム性が不要なタスクはオフピーク(18:00 以降または 9:00 前)にスケジュールする
  2. Prompt Cache を活用する。V4-Flash のキャッシュヒットは $0.0028/M のみ
  3. Flash で振り分け:単純ルーティングは Flash、複雑な推論は Pro にエスカレート
  4. 料金変更メールに注意する(DeepSeek は 24 時間前通知を約束)

ピーク時でも V4-Pro の出力 $1.74/M は、Claude Opus 4.8($15/M)より 8.6 倍安価です。

06API 移行ガイド(7月24日締切)

重要: 旧モデル名 deepseek-chatdeepseek-reasoner2026年7月24日 15:59 UTC(北京時間 23:59)に永久停止します。
旧モデル名新モデル名備考
deepseek-chatdeepseek-v4-flash(非思考モード)高速、軽量タスク向け
deepseek-reasonerdeepseek-v4-flash(思考モード)または deepseek-v4-pro へアップグレードしてより強力な推論を取得
Python OpenAI SDK 移行例
client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[...],
)
Anthropic SDK 互換記述
client = anthropic.Anthropic(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)
message = client.messages.create(
    model="deepseek-v4-pro",
    max_tokens=4096,
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)

V4 は OpenAI ChatCompletions と Anthropic Messages の両フォーマットに対応しています。base_url は変更せず、model パラメータのみ更新すれば移行できます。

076ステップ Runbook:V4 GA 本番導入

  1. 01
    コードベースを監査deepseek-chatdeepseek-reasoner を全体検索し、すべての呼び出し箇所と環境変数をリストアップします。
  2. 02
    ターゲットモデルを選定:軽量な対話は deepseek-v4-flash、複雑な Agent/コードは deepseek-v4-pro。思考モードは extra_body で有効化します。
  3. 03
    Staging でスモークテスト:7月24日までにステージング環境で Non-think / Think High / Think Max の3モードの出力品質を検証します。
  4. 04
    ピーク・オフピークスケジュールを設定:バッチ文書処理やコードレビューなどのオフラインタスクを 18:00 以降または週末に cron 設定し、キャッシュヒット率 80% 以上を目標にします。
  5. 05
    Flash→Pro ルーティングを構築:意図分類と FAQ は Flash(出力 $0.28/M)、複雑な推論は Pro にエスカレートします。
  6. 06
    Agent ホストをデプロイ:長時間の V4 Agent セッションには安定した SSH と隣接テナントとのリソース競合のない環境が必要です。料金ページNUKCLOUD 専用 Mac ノードを評価し、CI と Agent ビルド基盤として利用することで、共有プールの尾部遅延が API コスト削減効果を相殺するのを防げます。

08まとめと FAQ

DeepSeek V4 GA は 2026 年のオープンソース大規模言語モデル分野における最重要マイルストーンの一つです。その価値は Claude Fable 5 や GPT-5.6 を上回ること(現時点ではまだ不可能)にあるのではなく、クローズド旗艦の 1/10 から 1/100 のコストで、オープンソース最強クラスの性能を提供することにあります。ピーク・オフピーク料金はコスト管理を複雑にしますが、本質的には依然として極めて競争力があります。DeepSeek が「価格破壊者」から「ルールのある商用プラットフォーム」へ移行したことは、成熟化のシグナルと言えるでしょう。

チームが V4 で大規模コードベースに対する長時間 Agent 呼び出しを行う場合、安定した監査可能なローカル開発と CI 基盤が依然として必要です。共有分課金プール、デスク下の Mac、オーバーサブスク VPS では、帯域ジッター、隣接 CPU 競合、長時間接続の切断が Token 値下げの恩恵をすぐに食い潰します。より安定した本番 Agent ホストには、NUKCLOUD の多リージョン裸金属 Mac / クラウド Mac ノードが専用 Apple Silicon 算力と明確なテナント境界を提供します。料金ページで仕様を確認し、注文ページから試験環境をプロビジョニングできます。

DeepSeek V4 満血版とプレビュー版の違いは何ですか?
GA 版では Agent、数学推論、コード生成が重点強化され、ピーク・オフピーク料金が導入されました。基盤の 1.6T MoE 架構は変わりませんが、本番安定性と商用体系が整備されています。
ピーク・オフピーク料金のピーク時間帯はいつですか?
北京時間の平日 09:00–12:00 と 14:00–18:00 は料金が2倍です。それ以外はオフピーク料金が適用されます。バッチタスクは 18:00 以降へのスケジュールを推奨します。
deepseek-chat はいつ停止しますか?
2026年7月24日 15:59 UTC(北京時間 23:59)に永久停止します。deepseek-v4-flash または deepseek-v4-pro への移行が必要です。
DeepSeek V4 はローカルにデプロイできますか?
可能です。MIT ライセンスでオープンソース化されています。大容量メモリの Apple Silicon で Flash 変種を実行できます。詳細は当サイトの ds4 ローカル推論 Runbookを参照してください。
DeepSeek V4 と GPT-5.6 はどちらがコスパに優れていますか?
V4-Pro の出力はオフピーク $0.87/M、ピーク $1.74/M で、GPT-5.6 Sol(約 $15/M)の約 1/17 です。SWE-bench Verified で 80.6% のオープンソース記録を樹立しており、コストパフォーマンスは突出しています。
Agent CI はどのインフラで実行すべきですか?
長時間の V4 Agent には安定した SSH、予測可能なディスク I/O、隣接テナントとのリソース競合のない環境が必要です。NUKCLOUD 専用 Mac ノードは Agent ホストと CI ビルド基盤として適しています。

データ截至:2026-07-20。出典:DeepSeek 公式ドキュメント、arXiv:2606.19348、HuggingFace モデルページ、LLMReference、Artificial Analysis、MangoMind Blog。