DeepSeek V4 Flash正式版評測:ベンチマークがOpus 4.8に迫る、価格は約100分の1、Pro版はいつ?

2026年7月31日、DeepSeekは V4-Flash-0731 をAPI正式版として公開しました。284B/13Bの架構は4月プレビューと同一で、後訓練のみが刷新されています。Agentベンチでは自社のより大きなV4-Proプレビューを上回り、Claude Opus 4.8の数十分の一の価格帯。一方、旗艦 V4-Pro公式版 と自社Agentフレームワーク Harness は未公開のままです。

要約:7月31日の deepseek-v4-flash 正式版は新モデルではなく、同一284B/13B MoEへの後訓練再実行です。API料金は入力 $0.14(キャッシュミス)/$0.0028(ヒット)、出力 $0.28/M、MITライセンス。本記事ではV4 GA全体像を前提に、タイムライン・Harness・Kimi K3/GLM-5.2/Qwen3.8-Max比較・跑分争議・キルライン(斩杀線)・6ステップRunbook・FAQを整理します。ローカル評価はds4 Mac推論ガイドも参照してください。

00V4-Flash-0731 とは何が変わったのか

DeepSeek-V4-Flash-0731は、2026年7月31日にAPI公測として昇格した 284B総パラメータ・13B活性 のMoEモデルです。4月24日プレビューとパラメータ規模・ネットワーク構造は完全に同一で、DeepSeek公式は性能向上が「後訓練の再実行のみ」に由来すると明言しています。100万トークンコンテキスト、MITオープンウェイト、Hugging Face同期公開は継続です。

今回の更新はAPIのみ——消費者向けアプリとWebチャットは旧ビルドのままです。旗艦V4-Proの公式版とHarnessはchangelog上「近日公開」扱いで、確定日はありません。

項目V4-Flash-0731(正式版)V4-Pro(プレビューのみ)
総 / 活性パラメータ284B / 13B1.6T / 49B
コンテキスト1M トークン1M トークン
入力(ミス / ヒット)$0.14 / $0.0028 每M$0.435 / $0.003625 每M
出力$0.28 每M$0.87 每M
ライセンスMITMIT
ステータス(8/5時点)API正式版プレビュー継続、公式版未発表
引用可能データ:① 架構不変・284B/13B;② 公式API $0.14/$0.28(オフピーク、キャッシュミス/出力);③ Terminal Bench 2.0 自社報告 82.7(V4-Proプレビュー67.9を上回る);④ Artificial Analysis Intelligence Index 50、タスク単価 $0.03

痛点正式版ラベルの裏側にある制約

  • 「新モデル」ではない:参数量を増やしていないため、世界知識の上限は架構上変わりません。Agent・コード系ベンチの伸びは後訓練と評価条件に依存します。
  • Harness未公開:Terminal Bench 2.0等の目立つスコアは、未リリースHarnessのminimal modeで測定。Claude CodeやCursorへの汎化は未検証です。
  • キャッシュヒット率の実務課題:海外開発者コミュニティでは入力キャッシュ命中率が低い、安全分類器のタイムアウトなどの報告があり、算力・運用面のボトルネックが残ります。
  • APIのみ更新:エンドユーザー向けアプリ未同期のため、社内評価(API)と製品体験(App)が食い違う期間が続きます。
  • ピーク料金の不確実性:DeepSeekは北京時間ピーク2倍加算を予告済みですが、8月5日時点で発効日は未確定です。
  • 夏の競合集中:7/24 API移行、7/27 Kimi K3ウェイト、7/31 Flash正式版、8/3 Qwen3.8-Max GAと、ルーティング未更新のチームはコストと品質がすり合いません。

01タイムライン:4月プレビューから7月正式版へ

日付イベント
2026-04-24V4プレビュー+MITオープンソース。V4-Pro(1.6T/49B)とV4-Flash(284B/13B)、100万トークン
2026-07-24deepseek-chat / deepseek-reasoner 永久停止、V4系命名へ全面移行
2026-07-27Kimi K3(2.8T)Hugging Face全面公開
2026-07-31V4-Flash-0731 API正式版、ウェイト同期、Harness初言及(未公開)
2026-08-02〜03Qwen3.8-Max GA(API $2/$6、ウェイトは来週予定)
2026-08-05V4-Pro公式版・Harness公開日未確定(8/10〜20 GA等は未確認の噂)

02後訓練と架構:CSA+HCA、mHC、Muon

0731ビルドは架構を変えていませんが、V4ファミリー全体の技術基盤は理解しておく価値があります。技術報告『DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence』によると、主要要素は次の3点です。

  • 混合アテンション(CSA + HCA):圧縮スパースアテンションと高度圧縮アテンションの組み合わせ。100万トークンでV3.2比推論FLOPs 27%、KV Cache 10%(Flashは7%)と公式報告。
  • mHC(多様体制約ハイパーコネクション):深い61層でも信号が安定伝播する残差構造の改良。
  • Muonオプティマイザ:収束速度と訓練安定性の向上。

0731の教訓は「より大きい≠より強い」です。284B/13Bが1.6T/49BのV4-Proプレビューを複数Agentベンチで上回ったことは、2026年下半期の競争が後訓練品質へシフトしている証拠と読めます。

03DeepSeek Harness:初の自社Agentフレームワーク

7月31日changelogで初めて名前が付いた DeepSeek Harness は、ファイルI/O・ツール呼び出し・多段階エンジニアリングタスク向けの自社Agent実行基盤で、Claude Codeに位置づけられています。これまでDeepSeekはClaude CodeやOpenCode等の第三者Harnessに依存してきました。

公開されたAgent系ベンチ(Terminal Bench 2.0、Toolathlon等)はすべてHarness minimal mode(未公開)で、max推論、top_p=0.95、temperature=1.0の条件下で測定されています。DeepSeek自身も「跑分はharness選択に極めて敏感」と警告しており、数字をモデル単体能力と同一視しないことが重要です。

ベンチマーク(ベンダー自報)V4-Flash-0731V4-Proプレビュー
Terminal Bench 2.082.767.9
測定条件Harness minimal mode(未公開)、max / top_p=0.95 / temp=1.0

04横断比較:Kimi K3・GLM-5.2・Qwen3.8-Max・クローズド旗艦

モデル総パラメータIntelligence Indexタスク単価API入/出 ($/M)ウェイト
V4-Flash-0731284B50$0.03$0.14 / $0.28MIT公開済
Kimi K32.8T57$0.86$3 / $157/27公開
GLM-5.2(智谱)~744BV4-Flash比+1点程度本記事未核实本記事未核实MIT(6月)
Qwen3.8-Max2.4T / 95B活性本記事未核实本記事未核实$2 / $6来週予定
GPT-5.6 Sol非公開+9点以上$1.86クローズド
Claude Opus 4.8 / Fable 5非公開+9点以上$3.15前後高単価帯

Intelligence Indexとタスク単価は第三者機関Artificial Analysisのデータ(财经媒体経由)です。DeepSeek自社Agent跑分とは方法論が異なり、直接合算比較できません。興味深いのは、IndexではK3やGLM-5.2がFlashより上でも、タスク単価はK3の約1/29、GPT-5.6 Solの約1/62、Claude Fable 5の約1/105に抑えられている点です。DeepSeekは「跑分1位」ではなく「十分な知能+極限価格」でOpenRouter7週連続1位を取った戦略を継続しています。

Claude Opus 4.8との価格差(21世紀経済報道等):キャッシュミス入力で約36倍、キャッシュヒット入力で約179倍、出力で約89倍安いとされます。ベンダーリスト価格の目安です。

05争議点:跑分の読み方と未確認情報

  • Harness依存の自社跑分:82.7のTerminal Bench 2.0は未公開フレームワーク依存。独立再現(Claude Code、Cursor等)待ち。
  • 実利用の齟齬:キャッシュ命中率低下、安全分類器タイムアウトなど、跑分叙事と運用体感のギャップ。
  • V4-Pro / Harness日程:「8月10〜20日GA」等は未署名ソースの噂。公式は「できるだけ早く」のみ。
  • 資金調達・IPO報道:約74億ドル調達、487億ドル估值等は财经媒体の「据报道」レベル。規制書類・公式声明なし。

06キルライン(斩杀線)と価格戦の次局面

中国AIコミュニティでは、V4-Pro中旬GAがずれた時期に創業者梁文锋を「梁白开(空約束)」と揶揄し、0731正式版の上振れ後に「梁圣(賢人)」と呼び返す——という感情の反転が話題になりました。より実務的な概念が 「斩杀線(キルライン)」 です。

キルラインとは、DeepSeekの「十分な性能+極端な低価格」が市場に敷く生存閾値を指します。性能がDeepSeekを明確に上回らず、かつ価格も下回れない競合は存在感を失う——この枠組みは、同期間のGPT-5.6 Luna 80%値下げなど、各社の密集した価格調整を説明します。

7月31日当日、Nvidia・Broadcom・AMD等の算力株に大きな変動はありませんでした。2025年初のDeepSeek-R1 shockと対照的で、市場は「少ない算力で同等効果」を異常事態ではなくエンジニアリング進歩として受け止め始めています。

076ステップ Runbook:V4-Flash-0731 本番接続

OpenAI SDK(Python)
from openai import OpenAI

client = OpenAI(
    api_key="your_deepseek_api_key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-flash",
    messages=[{"role": "user", "content": "このPRの差分を要約し、テスト観点を列挙して"}],
    extra_body={"thinking": {"type": "enabled"}}
)
print(response.choices[0].message.content)
  1. 01
    旧モデル名の残骸を監査:deepseek-chat / deepseek-reasoner をコードベース全体検索。7月24日以降も残存していれば即修正します。
  2. 02
    deepseek-v4-flash が0731を指すことを確認:同一model名で自動切替のため、Stagingで出力品質とレイテンシのベースラインを記録します。
  3. 03
    思考モードとルーティング設計:軽量タスクはNon-think、Agent/コードはThink High。複雑推論のみV4-Proプレビューへエスカレーション。
  4. 04
    Prompt Cacheとトークン監視:入力$0.14 vs $0.0028の差は巨大です。キャッシュ命中率、P95レイテンシ、タスク成功率をダッシュボード化します。
  5. 05
    自社HarnessでA/B:Terminal Bench自報値を鵜呑みにせず、本番リポジトリ20〜50件でK3・Qwen3.8-Max・現行モデルと並走比較します。
  6. 06
    Agentホストを確保:7×24のHarness/CI連携には安定SSHと専有算力が必要です。料金ページNUKCLOUD裸金属Macノードを評価し、注文ページから試験環境をプロビジョニングします。

08まとめと FAQ

V4-Flash-0731は「新旗艦」ではなく、同一284Bへの後訓練刷新API正式化です。Agent跑分は印象的ですがHarness依存、第三者IndexではK3/GLM-5.2に指数点で劣る一方、タスク単価は圧倒的です。本番採用前に自社タスクでの検証が必須です。

大規模AgentパイプラインをV4-Flashで回すチームには、API単価 $0.14/$0.28 の節約効果を帯域ジッター・隣接CPU争い・長時間SSH切断が相殺しない環境が必要です。共有VPSやオーバーサブスクmacOSでは、月次請求は下がってもタスク成功率が落ちることがあります。より安定した本番Agentホストには、NUKCLOUD多リージョン裸金属Mac / クラウドMacノードが独占Apple Siliconと明確なテナント境界を提供します。料金ページで仕様を確認し、注文ページから試験ノードを確保できます。

  • V4-Flash-0731は新しいモデルですか?
    いいえ。284B/13B架構は4月プレビューと同一で、後訓練のみ刷新されています。
  • FlashとProプレビューはどちらを選びますか?
    大量・低コストAgent、バッチ処理はFlash正式版。深い世界知識・複雑推論で予算に余裕があればProプレビューを暫定利用し、公式版GA後に再評価してください。
  • Harnessは今使えますか?
    changelogで名称のみ公開。一般利用者向けリリースは未確認です。Claude Code等の既存Harnessで評価を進めてください。
  • 公式跑分は信頼できますか?
    SWE-bench Verified等は比較的可信。Terminal Bench 2.0等は未公開Harness依存——DeepSeek自身もharness敏感を警告しています。
  • V4-Pro公式版はいつですか?
    確定日なし。8/10〜20 GA等は未確認の噂。公式changelogを唯一の根拠にしてください。
  • ローカル推論は可能ですか?
    MITウェイトはHugging Face公開済みです。高メモリApple Silicon向け手順はds4 Runbookを参照してください。

データ截至:2026-08-05。出典:DeepSeek APIドキュメント・changelog、技術報告、Hugging Face、Artificial Analysis(财经媒体経由)、21世紀経済報道、Moonshot/智谱/阿里公式情報。