3か月の待機を経て、DeepSeek V4 満血版(GA正式版)が2026年7月20日に公開されました。2026年のオープンソース大規模言語モデルを選定している開発者、または deepseek-chat エンドポイント停止を懸念するSRE/テックリード向けに、技術アーキテクチャ、ベンチマーク、ピーク/オフピーク課金、GPT-5.6 / Claude Fable 5との横比較、7月24日までのAPI移行を5軸で整理します。結論:V4は現時点でクローズドフラッグシップを上回れませんが、1/10〜1/100のコストでオープンソース最強性能を提供します。ピーク課金は複雑ですが、オフピーク出力$0.87/Mは依然として圧倒的です。
SECTION 01 DeepSeek V4 GA公開で開発者が警戒すべき3つの論点
- 旧エンドポイントの永久停止:
deepseek-chatとdeepseek-reasonerは2026年7月24日23:59(北京時間)にアクセス不可となり、未移行の本番サービスは即座に停止します。 - 初のピーク/オフピーク課金:平日09:00–12:00、14:00–18:00(北京時間)は料金が2倍。24/7パイプラインをスケジューリングしないと請求が想定を超える可能性があります。
- クラウドAPIはネイティブビルドを代替できない:どれほど強力なV4-Proでも、仮想化macOS上でXcode署名やMetalデバッグを安定運用することはできません。Mac Mini M4 レンタル vs 購入コスト比較で論じた物理ノード要件と相補的です。
- プレビュー版と満血版の境界:GA版はAgent・数学推論・コード生成を強化しましたがアーキテクチャは同一。4月プレビューの再評価ではなく、新料金と新ベンチマークで選定してください。
SECTION 02 プレビューから満血版へ:DeepSeek V4 リリース年表
| 日付 | イベント |
|---|---|
| 2026-04-24 | V4プレビュー公開 + MITオープンソース(V4-Pro 1.6T、V4-Flash 284B) |
| 2026-05 | 本番向けチューニング版公開、API正式利用開始 |
| 2026-06 | V4-Pro出力単価を75%値下げ、$0.87/M tokensに恒久改定 |
| 2026-06-29 | 全APIユーザーへメール通知、7月中旬GAとピーク課金を初公開 |
| 2026-07-19 | 複数開発者がGAグレーンテスト資格を取得、メディアが「満血版は明日公開」と報道 |
| 2026-07-20 | GA正式版公開 |
| 2026-07-24 | deepseek-chat / deepseek-reasoner 永久停止 |
要約すると、プレビュー版は既に強力でしたが、満血版はAgent・数学・コード生成をさらに磨き、正式な商用課金体系を整備——「ほぼ無料」から規律あるビジネス運用へ移行した節点です。
SECTION 03 V4-Pro / V4-Flash:CSA+HCAアーキテクチャと3つの推論モード
| 項目 | V4-Pro | V4-Flash |
|---|---|---|
| 総パラメータ数 | 1.6兆(1.6T) | 2840億(284B) |
| トークンあたり活性化 | 490億(49B) | 130億(13B) |
| Transformer層数 | 61層 | 43層 |
| コンテキストウィンドウ | 1,000,000 tokens | 1,000,000 tokens |
| 最大出力 | 384K tokens | 384K tokens |
| 精度 | FP4(エキスパート)+ FP8(その他) | FP4 + FP8 混合 |
| 事前学習データ | 33T+ tokens | 32T+ tokens |
| ライセンス | MIT | MIT |
DeepSeek V4はV2/V3時代のMLA(Multi-head Latent Attention)を廃止し、Compressed Sparse Attention(CSA)とHeavily Compressed Attention(HCA)のハイブリッドを採用しています。CSAはSoftmaxゲート付きプーリングでKV列を4倍圧縮し、FP4「ライトニングインデクサー」でtop-k疎選択(Proはtop-1024、Flashはtop-512)を行い、直近128 tokenのスライディングウィンドウを保持します。HCAはtokenを128倍圧縮してグローバル密集アテンションを実行し、CSAと補完関係にあります。1MコンテキストではV3.2比推論FLOPs 27%、KV CacheメモリはV3.2の10%(Flashは7%)に抑えられます。
さらにmanifold-constrained Hyper-Connections(mHC)が4チャネル残差フローと双確率行列制約で61層深ネットの信号伝播を安定化。訓練にはAdamWの代わりにMuonオプティマイザ(Newton–Schulz直交化勾配)を採用し、収束が速く安定します。
| モード | 特徴 | 用途 |
|---|---|---|
| Non-think | 思考チェーンなし、最速応答 | 単純QA、ルーティング |
| Think High | 明示的推論(思考タグ付き) | 中程度の複雑タスク、コードデバッグ |
| Think Max | 最大推論、384K+コンテキスト推奨 | 高度数学、長チェーンAgent |
推奨サンプリング:temperature=1.0, top_p=1.0(全モード共通)。
SECTION 04 ベンチマーク:オープンソース最高80.6%とコストパフォーマンス
| ベンチマーク | DeepSeek V4-Pro | Claude Fable 5 | GPT-5.6 Ultra | Claude Opus 4.8 |
|---|---|---|---|---|
| SWE-bench Verified | 80.6% | 96.0% | 個別未公開 | ~69% |
| SWE-bench Pro | 55.4% | 80.3% | 78.1% | 69.2% |
| LiveCodeBench (Pass@1) | 93.5% | 88.1% | 87.4% | 83.2% |
| Codeforces Elo | 3,206 | — | — | — |
| Terminal-Bench 2.1 | 83.9% | 88.0% | 85.1% | 82.7% |
SWE-bench Verifiedは実GitHubリポジトリのバグ修正を測定し、80.6%は現時点のオープンソース最高でGemini 3.1 Proと同率です。Artificial Analysisによると、Strategy & Ops指数タスクでClaude Fable 5は1回$3.48で50点、V4-Proは$0.03で38点——コストはFable 5の116倍安く、得点差は約12点(31%)です。
SECTION 05 GPT-5.6 / Claude Fable 5 比較とピーク/オフピーク料金表
| 軸 | DeepSeek V4-Pro | GPT-5.6 Sol | Claude Fable 5 |
|---|---|---|---|
| オープンソース / 自前運用 | MIT | クローズド | クローズド |
| コンテキスト | 1M tokens | 非公開 | 1M tokens |
| API出力(オフピーク) | $0.87/M | ~$15/M | $50/M |
| API出力(ピーク) | $1.74/M | — | — |
| コード能力 | 非常に高(Fable 5に接近) | 非常に高 | 最高 |
| データプライバシー | プライベートデプロイ可 | 不可 | 不可 |
選定指針:予算重視・高頻度呼び出し・自前運用 → V4-Pro / V4-Flash。コード性能最優先でコスト不問 → Claude Fable 5。複雑アルゴリズム+数学 → GPT-5.6 Sol / Ultra。超大規模ログ → V4-Flash(キャッシュヒット入力$0.0028/M)。Kimi K3 徹底レビューと併読すると、K3はパラメータ規模が大きい一方、V4はオフピーク単価が低くMIT重みが既に利用可能です。
| モデル | 課金項目 | オフピーク | ピーク |
|---|---|---|---|
| V4-Pro | 入力(キャッシュヒット) | ¥0.025 / $0.0035 / 1M | 2倍 |
| V4-Pro | 入力(キャッシュミス) | ¥3.00 / $0.435 / 1M | ¥6.00 / $0.87 / 1M |
| V4-Pro | 出力 | ¥6.00 / $0.87 / 1M | ¥12.00 / $1.74 / 1M |
| V4-Flash | 入力(キャッシュヒット) | ¥0.02 / $0.0028 / 1M | 2倍 |
| V4-Flash | 入力(キャッシュミス) | ¥1.00 / $0.14 / 1M | ¥2.00 / $0.28 / 1M |
| V4-Flash | 出力 | ¥2.00 / $0.28 / 1M | ¥4.00 / $0.56 / 1M |
コスト削減:非リアルタイムジョブは18:00以降または9:00前に実行。Prompt Cacheでヒット率を上げる。軽量ルーティングはV4-Flash、複雑推論はV4-Pro。ピーク時でもV4-Pro出力$1.74/MはClaude Opus 4.8($15/M)より8.6倍安いです。
SECTION 06 API移行:7月24日締切までの6ステップ
重要:旧モデル名 deepseek-chat / deepseek-reasoner は 2026年7月24日15:59 UTC(北京時間7月24日23:59) に永久停止します。
| 旧モデル | 新モデル | 備考 |
|---|---|---|
deepseek-chat |
deepseek-v4-flash(非思考) |
高速、軽量タスク向け |
deepseek-reasoner |
deepseek-v4-flash(思考モード) |
または deepseek-v4-pro へ昇格 |
- 旧モデル名を全リポジトリ検索:コード、CI設定、環境変数から
deepseek-chat/deepseek-reasonerを洗い出します。 - 移行先を決定:軽量対話 →
deepseek-v4-flash。複雑推論 →deepseek-v4-pro。 - OpenAI SDK呼び出しを更新:
modelのみ変更、base_urlはhttps://api.deepseek.comのまま。 - 思考モードを設定(任意):
extra_bodyで thinking を有効化し、旧deepseek-reasoner相当の挙動を再現します。 - Stagingで負荷試験:レイテンシ、token課金、ピーク時間帯の請求を検証します。
- 7月24日前にカナリアリリース:本番切替後にエラー率を監視。DeepSeekは料金変更24時間前にメール通知を約束しています。
from openai import OpenAI
client = OpenAI(
api_key="your-deepseek-api-key",
base_url="https://api.deepseek.com"
)
response = client.chat.completions.create(
model="deepseek-v4-pro",
messages=[{"role": "user", "content": "Hello, DeepSeek V4!"}],
extra_body={"thinking": {"type": "enabled", "budget_tokens": 8000}}
)
V4はOpenAI ChatCompletionsとAnthropic Messagesの両形式に対応。Anthropic SDK利用時も base_url は変更せず、model を deepseek-v4-pro に更新するだけです。
SECTION 07 引用可能データと権威ソース
- KV Cache効率:1MコンテキストでV3.2の10%メモリ(Flash 7%)
- 推論FLOPs:1MシナリオでV3.2比27%
- コスパ:V4-Pro 1タスク$0.03 vs Fable 5 $3.48、116倍差
- ピークでも安い:ピーク出力$1.74/M、Opus 4.8の1/8.6
- 移行期限:2026-07-24 23:59 北京時間
- 推奨サンプリング:temperature=1.0, top_p=1.0
公式・第三者ソース(リリース後にリンクを再確認してください):
arXiv:2606.19348 — DeepSeek V4 技術論文
Artificial Analysis — モデルコスパ評価データ
DeepSeek V4 GAは2026年オープンソースLLMの最重要マイルストーンの一つです。価値はClaude Fable 5やGPT-5.6を超えることではなく、極低コストでオープンソース最強性能を届ける点にあります。しかしクラウドLLMはXcodeコンパイル、Metalデバッグ、iOS証明書チェーンを代替できません。仮想化macOSはEULAリスクと20–40%の性能損失を伴います。実戦構成はV4 APIで長コンテキスト推論とAgent編成を担い、VPSNIX M4/M4 Pro物理ノードでXcode/Metalネイティブビルドと7×24運用を行う二層スタック——100%純正ハードウェア、完全Root権限、Hypervisorオーバーヘッドなし。料金ページで見積もりを確認してください。Kimi K3 徹底レビューを読んだなら、単一APIベンダーの値上げに賭けるより、コンプライアンス準拠の物理環境に計算リソースを固定すべきです。
SECTION 08 よくある質問 FAQ
満血版GAとプレビュー版の違いは?
アーキテクチャは同一。GA版はAgent・数学・コード生成を強化しピーク課金を導入。旧エンドポイント deepseek-chat / deepseek-reasoner は7月24日停止します。
ピーク時間帯はいつですか?
平日北京時間09:00–12:00と14:00–18:00で料金2倍。それ以外はオフピーク単価です。
V4-ProとV4-Flashはどう選びますか?
Flashは軽量ルーティング・高頻度呼び出し(出力$0.28/M)。Proは複雑推論・コード(出力$0.87/M、SWE-bench Verified 80.6%)。
DeepSeek V4を自前運用できますか?
MITライセンスで可能です。V4-Pro 1.6Tは大規模GPUクラスタが必要で、多くのチームはAPI利用の方が経済的です。