結論: DeepSeek V4 GA は MIT オープンソース + 100万トークンコンテキスト + SWE-bench Verified 80.6% のオープンソース記録により、クローズド旗艦の 1/10 から 1/100 のコストでオープンソース最強クラスの性能を提供します。本記事ではタイムライン、技術架構(CSA/HCA/mHC/Muon)、ベンチマーク、GPT-5.6 / Claude Fable 5 との比較、ピーク・オフピーク料金、7月24日 API 移行の6つの観点から整理し、6ステップ Runbook と FAQ も掲載します。プライベートデプロイが必要な場合は、当サイトの ds4 高メモリ Mac クラウド推論ガイドを参照してください。
00DeepSeek V4 満血版とは?
DeepSeek V4 満血版(GA、General Availability)は、DeepSeek が 2026 年 7 月 20 日に正式リリースした本番向け大規模言語モデルファミリーです。V4-Pro(1.6T パラメータ)とV4-Flash(284B パラメータ)の2規格が含まれ、いずれも MIT ライセンスでオープンソース化され、100万トークンのコンテキストと最大 384K トークンの出力に対応しています。
4月のプレビュー版と比べ、GA 版では Agent タスク、数学推論、コード生成が重点的に強化され、正式な商用課金体系——ピーク・オフピークの差別料金——が整備されました。旧インターフェース名 deepseek-chat と deepseek-reasoner は 7月24日に永久停止します。
- オープンソースでセルフホスト可能:MIT ライセンスにより、企業はデータ越境コンプライアンスを満たすプライベートデプロイが可能です。
- 100万トークンコンテキストが実用レベル:KV キャッシュのメモリ使用量は V3.2 の 10%(Flash は 7%)に抑えられています。
- オープンソース SWE-bench 記録:Verified で 80.6%、Gemini 3.1 Pro と並ぶオープンソース最高水準です。
- API コストパフォーマンス:V4-Pro の出力はオフピーク $0.87/M、ピーク $1.74/M で、Claude Fable 5 の約 1/57 です。
01タイムライン:プレビュー版から満血版へ
| 日付 | イベント |
|---|---|
| 2026-04-24 | V4 プレビュー版リリース + オープンソース(MIT)。V4-Pro(1.6T)と V4-Flash(284B)を含む |
| 2026-05 | 本番チューニング版リリース、API 正式利用開始 |
| 2026-06 | V4-Pro 価格を恒久的に 75% 値下げ(出力 $0.87/M トークン) |
| 2026-06-29 | 全 API ユーザーへメール送信。7月中旬の GA リリースとピーク・オフピーク料金を初公開 |
| 2026-07-19 | 複数の開発者が GA グレー内測資格を取得。メディアは「満血版は最短で翌日リリース」と報道 |
| 2026-07-20 | GA 正式版リリース(本記事公開日) |
| 2026-07-24 | 旧インターフェース deepseek-chat / deepseek-reasoner 永久停止 |
02技術架構の詳細解説
モデルファミリー一覧
| 仕様 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6 兆(1.6T) | 2840 億(284B) |
| トークンあたり活性パラメータ | 490 億(49B) | 130 億(13B) |
| Transformer 層数 | 61 層 | 43 層 |
| コンテキストウィンドウ | 1,000,000 トークン | 1,000,000 トークン |
| 最大出力 | 384K トークン | 384K トークン |
| 精度 | FP4(エキスパート重み)+ FP8(その他) | FP4 + FP8 混合 |
| 事前学習データ量 | 33T+ トークン | 32T+ トークン |
| オープンソースライセンス | MIT | MIT |
ハイブリッドアテンション機構(CSA + HCA)
DeepSeek V4 は V2/V3 時代の MLA を廃止し、2種類の新アテンション機構のハイブリッドを採用しています。
圧縮スパースアテンション(CSA):KV シーケンスを Softmax ゲート付きプーリングで 4 倍に圧縮し、FP4「ライトニングインデクサー」で top-k スパース選択(Pro は top-1024、Flash は top-512)を行います。同時に直近 128 トークンのスライディングウィンドウを保持します。100万トークンコンテキストでは V3.2 比で推論 FLOPs は 27%に抑えられます。
高密度圧縮アテンション(HCA):トークンを 128 倍に圧縮したうえでグローバル密集アテンションを行い、長距離依存を捉えます。Flash は最初の 2 層で HCA を使用し、その後 CSA/HCA を交互に配置します。Pro も同様の構造です。
総合効果:100万トークンシナリオでは KV キャッシュのメモリは V3.2 の 10%(Flash は 7%)にまで削減されます。
多様体制約ハイパーコネクション(mHC)と Muon オプティマイザ
mHC は従来の残差接続を拡張し、4 チャネルの残差ストリームと双確率行列制約(Birkhoff 多面体)を導入することで、61 層の深いネットワークでも信号が安定して伝播します。Muon オプティマイザはニュートン・シュルツ直交化で勾配を処理し、収束が速く、訓練が安定します。
3つの推論モード
| モード | 特徴 | 適用シナリオ |
|---|---|---|
| Non-think | 思考チェーンなし、高速応答 | 単純な Q&A、ルーティング振り分け |
| Think High | 明示的推論(<redacted_thinking> タグ) | 中程度の複雑タスク、コードデバッグ |
| Think Max | 最大推論強度、384K+ コンテキストが必要 | 複雑な数学、長チェーン Agent |
公式推奨サンプリングパラメータ:temperature=1.0, top_p=1.0(全モード共通)。
03ベンチマーク:オープンソース王者の成績表
| ベンチマーク | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6%(オープンソース最高) | 96.0% | 個別未公表 | 約 69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verified は実際の GitHub リポジトリでのバグ修正を測定するテストで、80.6% は現時点のオープンソースモデル最高記録です。より厳格な SWE-bench Pro では Claude Fable 5 が 80.3% でリードしています。
コストパフォーマンス横断比較
Artificial Analysis の評価データ(Strategy & Ops 指数タスク):
- Claude Fable 5:1回あたり $3.48、スコア 50 点
- DeepSeek V4-Pro:1回あたり $0.03、スコア 38 点
- DeepSeek V4-Flash:6種類の指数タスクいずれも 1回あたり $0.04 未満
Fable 5 のコストは V4-Pro の 116 倍ですが、スコアは約 12 点(31%)しか上回りません。Kimi K3 レビューと照らすと、K3 はパラメータ規模こそ大きいものの API 出力は $15/M であり、コスト重視のシナリオでは V4-Pro が依然として圧倒的な優位性を持ちます。
04GPT-5.6 / Claude Fable 5 との全面比較
| 観点 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープンソース | MIT ライセンス | クローズド | クローズド |
| セルフホスト | 対応 | 非対応 | 非対応 |
| コンテキストウィンドウ | 100万トークン | 未公開 | 100万トークン |
| コード能力 | 極めて強力(Fable 5 に接近) | 極めて強力 | 最強 |
| API 出力価格(オフピーク) | $0.87/M トークン | 約 $15/M | $50/M |
| ピーク出力価格 | $1.74/M トークン | — | — |
| Agent 能力 | 強力、マルチ Agent オーケストレーション対応 | 強力 | 最強 |
| データプライバシー | プライベートデプロイ可能 | 非対応 | 非対応 |
選定の指針:
- 予算制約・高頻度呼び出し・プライベートデプロイ:V4-Pro または V4-Flash を第一候補に
- 究極のコード能力、コスト不問:Claude Fable 5(SWE-bench Pro 最高スコア)
- 複雑なアルゴリズム + 数学推論:GPT-5.6 Sol / Ultra
- 超大規模ログ・文書処理:V4-Flash(キャッシュヒット入力は $0.0028/M のみ)
05ピーク・オフピーク料金の詳細:コスト最適化の方法
GA 版で最も注目された変化は、DeepSeek が初めてピーク・オフピークの差別料金を導入したことです。電力の時間帯別料金に似た仕組みです。ピーク時間帯(北京時間)は平日 09:00–12:00 と 14:00–18:00 で、料金は2倍になります。
| モデル | 課金項目 | オフピーク | ピーク |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | ¥0.025 / $0.0035 / 1M | 2倍 |
| 入力(キャッシュミス) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 | |
| 出力 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 | |
| V4-Flash | 入力(キャッシュヒット) | ¥0.02 / $0.0028 / 1M | 2倍 |
| 入力(キャッシュミス) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 | |
| 出力 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 |
コスト削減の4つの施策:
- リアルタイム性が不要なタスクはオフピーク(18:00 以降または 9:00 前)にスケジュールする
- Prompt Cache を活用する。V4-Flash のキャッシュヒットは $0.0028/M のみ
- Flash で振り分け:単純ルーティングは Flash、複雑な推論は Pro にエスカレート
- 料金変更メールに注意する(DeepSeek は 24 時間前通知を約束)
ピーク時でも V4-Pro の出力 $1.74/M は、Claude Opus 4.8($15/M)より 8.6 倍安価です。
06API 移行ガイド(7月24日締切)
deepseek-chat と deepseek-reasoner は 2026年7月24日 15:59 UTC(北京時間 23:59)に永久停止します。| 旧モデル名 | 新モデル名 | 備考 |
|---|---|---|
deepseek-chat | deepseek-v4-flash(非思考モード) | 高速、軽量タスク向け |
deepseek-reasoner | deepseek-v4-flash(思考モード) | または deepseek-v4-pro へアップグレードしてより強力な推論を取得 |
client.chat.completions.create(
model="deepseek-v4-pro",
messages=[...],
)
client = anthropic.Anthropic(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
message = client.messages.create(
model="deepseek-v4-pro",
max_tokens=4096,
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}]
)
V4 は OpenAI ChatCompletions と Anthropic Messages の両フォーマットに対応しています。base_url は変更せず、model パラメータのみ更新すれば移行できます。
076ステップ Runbook:V4 GA 本番導入
-
01
コードベースを監査:
deepseek-chatとdeepseek-reasonerを全体検索し、すべての呼び出し箇所と環境変数をリストアップします。 -
02
ターゲットモデルを選定:軽量な対話は
deepseek-v4-flash、複雑な Agent/コードはdeepseek-v4-pro。思考モードはextra_bodyで有効化します。 -
03
Staging でスモークテスト:7月24日までにステージング環境で Non-think / Think High / Think Max の3モードの出力品質を検証します。
-
04
ピーク・オフピークスケジュールを設定:バッチ文書処理やコードレビューなどのオフラインタスクを 18:00 以降または週末に cron 設定し、キャッシュヒット率 80% 以上を目標にします。
-
05
Flash→Pro ルーティングを構築:意図分類と FAQ は Flash(出力 $0.28/M)、複雑な推論は Pro にエスカレートします。
-
06
Agent ホストをデプロイ:長時間の V4 Agent セッションには安定した SSH と隣接テナントとのリソース競合のない環境が必要です。料金ページで NUKCLOUD 専用 Mac ノードを評価し、CI と Agent ビルド基盤として利用することで、共有プールの尾部遅延が API コスト削減効果を相殺するのを防げます。
08まとめと FAQ
DeepSeek V4 GA は 2026 年のオープンソース大規模言語モデル分野における最重要マイルストーンの一つです。その価値は Claude Fable 5 や GPT-5.6 を上回ること(現時点ではまだ不可能)にあるのではなく、クローズド旗艦の 1/10 から 1/100 のコストで、オープンソース最強クラスの性能を提供することにあります。ピーク・オフピーク料金はコスト管理を複雑にしますが、本質的には依然として極めて競争力があります。DeepSeek が「価格破壊者」から「ルールのある商用プラットフォーム」へ移行したことは、成熟化のシグナルと言えるでしょう。
チームが V4 で大規模コードベースに対する長時間 Agent 呼び出しを行う場合、安定した監査可能なローカル開発と CI 基盤が依然として必要です。共有分課金プール、デスク下の Mac、オーバーサブスク VPS では、帯域ジッター、隣接 CPU 競合、長時間接続の切断が Token 値下げの恩恵をすぐに食い潰します。より安定した本番 Agent ホストには、NUKCLOUD の多リージョン裸金属 Mac / クラウド Mac ノードが専用 Apple Silicon 算力と明確なテナント境界を提供します。料金ページで仕様を確認し、注文ページから試験環境をプロビジョニングできます。
deepseek-v4-flash または deepseek-v4-pro への移行が必要です。データ截至:2026-07-20。出典:DeepSeek 公式ドキュメント、arXiv:2606.19348、HuggingFace モデルページ、LLMReference、Artificial Analysis、MangoMind Blog。