Qwen3.8-Max正式リリース:2.4兆パラメータがArena世界5位、来週オープンソース予定

2026年8月3日、阿里巴巴が Qwen3.8-Max を一般提供開始しました。2.4兆パラメータ・推論時 95B 活性100万トークンのスパース MoE 旗艦が、LMSYS Arena Text で暫定 世界5位(1496点)、Vision で 2位を記録。API は入力 $2・出力 $6 と Kimi K3 より安価ですが、ウェイトは未公開——「オープンソース」ラベルと実態のギャップが今週の最大論点です。

要約:8月3日 GA の Qwen3.8-Max は、Kimi K3(7月27日 2.8T ウェイト公開)と DeepSeek V4-Flash(7月31日)が続く中国勢の「夏の三連弾」の締めくくりです。Arena 暫定5位・Vision2位・API $2/$6・来週 OSS 予告——一方で ベンチはすべてベンダー実行、盲テストでは Kimi 83 vs Qwen プレビュー 80。国行 Apple Intelligence の千問中核とも文脈が交差します。以下、仕様表・痛点・比較マトリクス・6ステップ Runbook・FAQ を整理します。

00Qwen3.8-Max とは

Qwen3.8-Max は阿里巴巴クラウド(Alibaba Cloud)の現行最大規模テキスト+ビジョンモデルです。総パラメータ 2.4兆(2.4T)、推論時に活性化されるのは 950億(95B)。スパース Mixture-of-Experts(MoE)で 1,048,576 トークン(100万)コンテキストをサポートします。同日、Qwen Office Agent——スプレッドシート・スライド・メールを横断するオフィス自動化エージェント——もベータ公開され、3.8-Max を中核推論エンジンとして位置づけています。

仕様Qwen3.8-Max
総パラメータ2.4兆(2.4T)
推論時活性95B
アーキテクチャスパース MoE + 長コンテキスト最適化
コンテキスト1,048,576 トークン
入力モダリティテキスト、画像(Vision 2位級)
API モデル IDqwen3.8-max
API 料金入力 $2 / 出力 $6 每百万トークン
Arena Text(暫定)#5、1496 点
Arena Vision(暫定)#2
オープンウェイト来週予定(8/3 時点未公開)
引用可能データ:① 総パラメータ 2.4T、活性 95B;② Arena Text 暫定 1496 点・世界5位;③ API $2/$6——Kimi K3($3/$15)比で出力75%安;④ 盲テスト Kimi 83 vs Qwen プレビュー 80

痛点「オープンソース」ラベル下の隠れリスク

  • ウェイト未公開のまま GA:8月3日時点で Hugging Face にファイルはなく、来週公開とされるものの、コンプライアンス要件でローカル評価・ファインチューニングが API のみでは不可能です。
  • ベンダー実行ベンチのみ:公開スコアは阿里巴巴・Moonshot・DeepSeek 各社が自社 harness で計測。単一数値での調達判断は危険です。
  • Arena 暫定順位の揺れ:1496 点・5位は投票蓄積中の暫定値。Vision 2位も同様に変動余地があります。
  • 1M コンテキストの課金罠:単価は Kimi より安いものの、Office Agent が長文・多モーダルを一括投入するとトークン総量が請求を支配します。
  • 夏の競合密度:K3(7/27 OSS)・V4-Flash(7/31)・3.8-Max(8/3)が2週間で集中。ルーティングポリシー未更新のチームはコストと品質がすり合わせられません。
  • Apple 連携と API SKU の混同:国行 Intelligence の千問バックエンドと 3.8-Max API は別契約・別 SLA です。

01競合比較——Kimi K3・DeepSeek・Arena

モデル総パラメータ活性コンテキストArena TextAPI 入/出 ($/M)ウェイト
Qwen3.8-Max2.4T95B1M暫定 #5 (1496)$2 / $6来週予定
Kimi K32.8T16/896 MoE1M$3 / $157/27 公開済
DeepSeek V4-Flashスパース128K低単価帯7/31
Claude Fable 5クローズド200K上位圏$3 / $15非公開

阿里巴巴の社内盲テスト(非公開プロンプトセット)では Kimi K3 が 83、Qwen3.8-Max プレビューが 80。GA 後の再計測は未発表です。Arena Text 1496 は LMSYS コミュニティ投票ベースで、ベンダー自報とは独立したシグナルとして併読してください。

02Qwen Office Agent とエコシステム

Qwen Office Agent は Excel・PowerPoint・Outlook 相当ワークフローを自然言語で編成するエージェント層です。3.8-Max の 1M コンテキストで「四半期報告書全文+関連メールスレッド」を一度に保持し、表計算とスライド生成を連鎖させる設計です。中国本土の企業向け SaaS 連携が先行し、グローバル API 利用者は DashScope 経由で同等推論のみ先行利用する形です。

別軸で、国行 Apple Intelligence の生成 AI 中核も千問系列です。3.8-Max は消費者端末には即時載せ替えされませんが、中国語品質・規制適合の実績は同エコシステムの信頼指標として読めます。

036ステップ Runbook——API 本番接続

DashScope OpenAI 互換(Python)
from openai import OpenAI

client = OpenAI(
    api_key="your_dashscope_api_key",
    base_url="https://dashscope.aliyuncs.com/compatible-mode/v1"
)

response = client.chat.completions.create(
    model="qwen3.8-max",
    messages=[{"role": "user", "content": "この四半期レポートの要約とリスク表を作成して"}]
)
print(response.choices[0].message.content)
  1. 01
    DashScope API Key 発行:阿里巴巴クラウドコンソールでキーを作成し、請求アラート(月次上限)を設定します。
  2. 02
    Qwen Chat で品質確認:本番 Agent 接続前に、代表タスク(長文要約・表生成・Vision QA)を Web UI で試し、K3 との差分を記録します。
  3. 03
    コンテキスト予算設計:1M ウィンドウを使う場合でも、Office ドキュメントはチャンク+要約キャッシュで input トークンを抑制します。
  4. 04
    混合ルーティング:長文 Office・中国語は 3.8-Max;最大 OSS ウェイト自ホストは Kimi K3;低コスト大量バッチは DeepSeek V4-Flash。
  5. 05
    メトリクス計測:input/output トークン、P95 レイテンシ、タスク成功率をダッシュボード化。Arena 1496 は参考値に留めます。
  6. 06
    来週のウェイト公開を監視:Hugging Face リリース後、ライセンス条項・量子化版・vLLM 対応を確認。料金ページで Agent ホストコストと合算して月次予算を確定します。

04NUKCLOUD Mac ノード——Agent CI の安定基盤

Qwen3.8-Max を Office Agent や Codex 代替ルートに組み込むと、Mac 上の Xcode プロジェクト・ローカル MCP サーバー・長時間 SSH セッションが同時に走ります。共有 VPS やオーバーサブスク macOS では 帯域ジッター・隣接 CPU 争い・長接続切断が API 単価 $2/$6 の節約を相殺しがちです。

7×24 の Agent ホストと監査可能なビルド平面には、NUKCLOUD 多リージョン裸金属 Mac / クラウド Mac ノードが独占 Apple Silicon・明確なテナント境界・リージョン主経路を提供します。料金ページで仕様を確認し、注文ページから試験ノードをプロビジョニングできます。ウェイト公開後の ローカル推論評価とも同一ノードで並行可能です。

  • Qwen3.8-Max のウェイトは今ダウンロードできますか?
    8月3日 GA 時点では未公開です。来週中の Hugging Face 公開が予告されていますが、確約ではありません。
  • Arena 5位は信頼できますか?
    暫定順位です。投票が増えると変動します。自社プロンプトでの A/B が最終判断材料です。
  • Kimi K3 より安いのに劣るのでは?
    盲テストでは Kimi 83 vs Qwen 80 でしたが、API は出力75%安、Arena Text 暫定5位、Vision2位。用途(Office・中国語・コスト)で分岐してください。
  • Apple Intelligence と同じモデルですか?
    いいえ。国行 Intelligence は別 SKU の千問バックエンドです。3.8-Max は DashScope API / Qwen Chat 向け旗艦です。
  • Agent CI はどこで動かすべきですか?
    長時間 DashScope 呼び出しとローカルツール連携には安定 SSH と専有算力が必要です。NUKCLOUD 独占 Mac ノードが共有プールより適しています。
  • ベンチマーク数値は第三者検証済みですか?
    いいえ。ベンダー自社実行が中心です。本番前に自社データで検証してください。

データ截止:2026-08-04。参考:阿里巴巴 Qwen 公式発表、LMSYS Arena 暫定ランキング、DashScope 料金表、Moonshot 盲テスト報道。