ホーム / ブログ / DeepSeek V4
ENGINEERING_BLOG · 2026.07.20

DeepSeek V4 満血版GA公開:料金・アーキテクチャとGPT-5.6との性能差

DEEPSEEK V4-PRO · SWE-bench Verified
80.6%

オープンソースモデル最高得点、Gemini 3.1 Proと同率。オフピーク出力は$0.87/Mから。

3か月の待機を経て、DeepSeek V4 満血版(GA正式版)が2026年7月20日に公開されました。2026年のオープンソース大規模言語モデルを選定している開発者、または deepseek-chat エンドポイント停止を懸念するSRE/テックリード向けに、技術アーキテクチャ、ベンチマーク、ピーク/オフピーク課金、GPT-5.6 / Claude Fable 5との横比較7月24日までのAPI移行を5軸で整理します。結論:V4は現時点でクローズドフラッグシップを上回れませんが、1/10〜1/100のコストでオープンソース最強性能を提供します。ピーク課金は複雑ですが、オフピーク出力$0.87/Mは依然として圧倒的です。

SECTION 01 DeepSeek V4 GA公開で開発者が警戒すべき3つの論点

  • 旧エンドポイントの永久停止:deepseek-chatdeepseek-reasoner は2026年7月24日23:59(北京時間)にアクセス不可となり、未移行の本番サービスは即座に停止します。
  • 初のピーク/オフピーク課金:平日09:00–12:00、14:00–18:00(北京時間)は料金が2倍。24/7パイプラインをスケジューリングしないと請求が想定を超える可能性があります。
  • クラウドAPIはネイティブビルドを代替できない:どれほど強力なV4-Proでも、仮想化macOS上でXcode署名やMetalデバッグを安定運用することはできません。Mac Mini M4 レンタル vs 購入コスト比較で論じた物理ノード要件と相補的です。
  • プレビュー版と満血版の境界:GA版はAgent・数学推論・コード生成を強化しましたがアーキテクチャは同一。4月プレビューの再評価ではなく、新料金と新ベンチマークで選定してください。

SECTION 02 プレビューから満血版へ:DeepSeek V4 リリース年表

DeepSeek V4 主要マイルストーン
日付 イベント
2026-04-24 V4プレビュー公開 + MITオープンソース(V4-Pro 1.6T、V4-Flash 284B)
2026-05 本番向けチューニング版公開、API正式利用開始
2026-06 V4-Pro出力単価を75%値下げ、$0.87/M tokensに恒久改定
2026-06-29 全APIユーザーへメール通知、7月中旬GAとピーク課金を初公開
2026-07-19 複数開発者がGAグレーンテスト資格を取得、メディアが「満血版は明日公開」と報道
2026-07-20 GA正式版公開
2026-07-24 deepseek-chat / deepseek-reasoner 永久停止

要約すると、プレビュー版は既に強力でしたが、満血版はAgent・数学・コード生成をさらに磨き、正式な商用課金体系を整備——「ほぼ無料」から規律あるビジネス運用へ移行した節点です。

SECTION 03 V4-Pro / V4-Flash:CSA+HCAアーキテクチャと3つの推論モード

DeepSeek V4 モデルファミリー仕様
項目 V4-Pro V4-Flash
総パラメータ数 1.6兆(1.6T) 2840億(284B)
トークンあたり活性化 490億(49B) 130億(13B)
Transformer層数 61層 43層
コンテキストウィンドウ 1,000,000 tokens 1,000,000 tokens
最大出力 384K tokens 384K tokens
精度 FP4(エキスパート)+ FP8(その他) FP4 + FP8 混合
事前学習データ 33T+ tokens 32T+ tokens
ライセンス MIT MIT

DeepSeek V4はV2/V3時代のMLA(Multi-head Latent Attention)を廃止し、Compressed Sparse Attention(CSA)Heavily Compressed Attention(HCA)のハイブリッドを採用しています。CSAはSoftmaxゲート付きプーリングでKV列を4倍圧縮し、FP4「ライトニングインデクサー」でtop-k疎選択(Proはtop-1024、Flashはtop-512)を行い、直近128 tokenのスライディングウィンドウを保持します。HCAはtokenを128倍圧縮してグローバル密集アテンションを実行し、CSAと補完関係にあります。1MコンテキストではV3.2比推論FLOPs 27%、KV CacheメモリはV3.2の10%(Flashは7%)に抑えられます。

さらにmanifold-constrained Hyper-Connections(mHC)が4チャネル残差フローと双確率行列制約で61層深ネットの信号伝播を安定化。訓練にはAdamWの代わりにMuonオプティマイザ(Newton–Schulz直交化勾配)を採用し、収束が速く安定します。

3つの推論モード
モード 特徴 用途
Non-think 思考チェーンなし、最速応答 単純QA、ルーティング
Think High 明示的推論(思考タグ付き) 中程度の複雑タスク、コードデバッグ
Think Max 最大推論、384K+コンテキスト推奨 高度数学、長チェーンAgent

推奨サンプリング:temperature=1.0, top_p=1.0(全モード共通)。

SECTION 04 ベンチマーク:オープンソース最高80.6%とコストパフォーマンス

V4-Pro 主要ベンチマーク
ベンチマーク DeepSeek V4-Pro Claude Fable 5 GPT-5.6 Ultra Claude Opus 4.8
SWE-bench Verified 80.6% 96.0% 個別未公開 ~69%
SWE-bench Pro 55.4% 80.3% 78.1% 69.2%
LiveCodeBench (Pass@1) 93.5% 88.1% 87.4% 83.2%
Codeforces Elo 3,206
Terminal-Bench 2.1 83.9% 88.0% 85.1% 82.7%

SWE-bench Verifiedは実GitHubリポジトリのバグ修正を測定し、80.6%は現時点のオープンソース最高でGemini 3.1 Proと同率です。Artificial Analysisによると、Strategy & Ops指数タスクでClaude Fable 5は1回$3.48で50点、V4-Proは$0.03で38点——コストはFable 5の116倍安く、得点差は約12点(31%)です。

SECTION 05 GPT-5.6 / Claude Fable 5 比較とピーク/オフピーク料金表

3大フロンティアモデル positioning
DeepSeek V4-Pro GPT-5.6 Sol Claude Fable 5
オープンソース / 自前運用 MIT クローズド クローズド
コンテキスト 1M tokens 非公開 1M tokens
API出力(オフピーク) $0.87/M ~$15/M $50/M
API出力(ピーク) $1.74/M
コード能力 非常に高(Fable 5に接近) 非常に高 最高
データプライバシー プライベートデプロイ可 不可 不可

選定指針:予算重視・高頻度呼び出し・自前運用 → V4-Pro / V4-Flash。コード性能最優先でコスト不問 → Claude Fable 5。複雑アルゴリズム+数学 → GPT-5.6 Sol / Ultra。超大規模ログ → V4-Flash(キャッシュヒット入力$0.0028/M)。Kimi K3 徹底レビューと併読すると、K3はパラメータ規模が大きい一方、V4はオフピーク単価が低くMIT重みが既に利用可能です。

ピーク/オフピーク完全料金表(ピーク:平日09:00–12:00・14:00–18:00 北京時間、2倍)
モデル 課金項目 オフピーク ピーク
V4-Pro 入力(キャッシュヒット) ¥0.025 / $0.0035 / 1M 2倍
V4-Pro 入力(キャッシュミス) ¥3.00 / $0.435 / 1M ¥6.00 / $0.87 / 1M
V4-Pro 出力 ¥6.00 / $0.87 / 1M ¥12.00 / $1.74 / 1M
V4-Flash 入力(キャッシュヒット) ¥0.02 / $0.0028 / 1M 2倍
V4-Flash 入力(キャッシュミス) ¥1.00 / $0.14 / 1M ¥2.00 / $0.28 / 1M
V4-Flash 出力 ¥2.00 / $0.28 / 1M ¥4.00 / $0.56 / 1M

コスト削減:非リアルタイムジョブは18:00以降または9:00前に実行。Prompt Cacheでヒット率を上げる。軽量ルーティングはV4-Flash、複雑推論はV4-Pro。ピーク時でもV4-Pro出力$1.74/MはClaude Opus 4.8($15/M)より8.6倍安いです。

SECTION 06 API移行:7月24日締切までの6ステップ

重要:旧モデル名 deepseek-chat / deepseek-reasoner2026年7月24日15:59 UTC(北京時間7月24日23:59) に永久停止します。

移行マッピング
旧モデル 新モデル 備考
deepseek-chat deepseek-v4-flash(非思考) 高速、軽量タスク向け
deepseek-reasoner deepseek-v4-flash(思考モード) または deepseek-v4-pro へ昇格
  1. 旧モデル名を全リポジトリ検索:コード、CI設定、環境変数から deepseek-chat / deepseek-reasoner を洗い出します。
  2. 移行先を決定:軽量対話 → deepseek-v4-flash。複雑推論 → deepseek-v4-pro
  3. OpenAI SDK呼び出しを更新:model のみ変更、base_urlhttps://api.deepseek.com のまま。
  4. 思考モードを設定(任意):extra_body で thinking を有効化し、旧 deepseek-reasoner 相当の挙動を再現します。
  5. Stagingで負荷試験:レイテンシ、token課金、ピーク時間帯の請求を検証します。
  6. 7月24日前にカナリアリリース:本番切替後にエラー率を監視。DeepSeekは料金変更24時間前にメール通知を約束しています。
deepseek_v4_migration.py
from openai import OpenAI

client = OpenAI(
    api_key="your-deepseek-api-key",
    base_url="https://api.deepseek.com"
)

response = client.chat.completions.create(
    model="deepseek-v4-pro",
    messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}],
    extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)

V4はOpenAI ChatCompletionsとAnthropic Messagesの両形式に対応。Anthropic SDK利用時も base_url は変更せず、modeldeepseek-v4-pro に更新するだけです。

SECTION 07 引用可能データと権威ソース

  • KV Cache効率:1MコンテキストでV3.2の10%メモリ(Flash 7%)
  • 推論FLOPs:1MシナリオでV3.2比27%
  • コスパ:V4-Pro 1タスク$0.03 vs Fable 5 $3.48、116倍差
  • ピークでも安い:ピーク出力$1.74/M、Opus 4.8の1/8.6
  • 移行期限:2026-07-24 23:59 北京時間
  • 推奨サンプリング:temperature=1.0, top_p=1.0

公式・第三者ソース(リリース後にリンクを再確認してください):

DeepSeek API 公式ドキュメント

arXiv:2606.19348 — DeepSeek V4 技術論文

Artificial Analysis — モデルコスパ評価データ

DeepSeek V4 GAは2026年オープンソースLLMの最重要マイルストーンの一つです。価値はClaude Fable 5やGPT-5.6を超えることではなく、極低コストでオープンソース最強性能を届ける点にあります。しかしクラウドLLMはXcodeコンパイル、Metalデバッグ、iOS証明書チェーンを代替できません。仮想化macOSはEULAリスクと20–40%の性能損失を伴います。実戦構成はV4 APIで長コンテキスト推論とAgent編成を担い、VPSNIX M4/M4 Pro物理ノードでXcode/Metalネイティブビルドと7×24運用を行う二層スタック——100%純正ハードウェア、完全Root権限、Hypervisorオーバーヘッドなし。料金ページで見積もりを確認してください。Kimi K3 徹底レビューを読んだなら、単一APIベンダーの値上げに賭けるより、コンプライアンス準拠の物理環境に計算リソースを固定すべきです。

SECTION 08 よくある質問 FAQ

満血版GAとプレビュー版の違いは?

アーキテクチャは同一。GA版はAgent・数学・コード生成を強化しピーク課金を導入。旧エンドポイント deepseek-chat / deepseek-reasoner は7月24日停止します。

ピーク時間帯はいつですか?

平日北京時間09:00–12:00と14:00–18:00で料金2倍。それ以外はオフピーク単価です。

V4-ProとV4-Flashはどう選びますか?

Flashは軽量ルーティング・高頻度呼び出し(出力$0.28/M)。Proは複雑推論・コード(出力$0.87/M、SWE-bench Verified 80.6%)。

DeepSeek V4を自前運用できますか?

MITライセンスで可能です。V4-Pro 1.6Tは大規模GPUクラスタが必要で、多くのチームはAPI利用の方が経済的です。