ホーム / ブログ / V4 Flash
ENGINEERING_BLOG · 2026.08.05

DeepSeek V4 Flash公式版:ベンチはOpus 4.8に迫るが価格は数十分の一、Pro版はまだ待ち

V4-FLASH-0731 · TERMINAL BENCH 2.0
82.7

V4-Proプレビュー67.9を上回る · 入力$0.14/M(キャッシュミス)· 284B総量/13B活性 · 2026年7月31日公式版

2026年7月31日、DeepSeekはV4-Flashを公式版(build 0731)へ昇格しました。パラメータ規模は4月プレビューと同一(284B総量・13B活性)で、後学習のみ再実行——それでもAgentベンチマークでは自社の1.6T V4-Proプレビューを上回り、価格はClaude Opus 4.8のおよそ36分の1〜179分の1です。本記事では、MLエンジニアとエンタープライズ選定担当者向けに、タイムライン、料金マトリクス、自研Harnessフレームワークの論点、Kimi K3Qwen3.8-Maxとの横断比較を整理します。結論として、V4-Flash-0731は「十分な知能+極端な低価格」を狙った製品であり、リーダーボード1位争いではありません。公式V4-ProとHarnessは未公開のままなので、選定時はスコアより検証可能性を優先してください。

SECTION 01 V4-Flash公式版で技術選定者が見落としやすい5つの論点

  • 新モデルではなく同一アーキテクチャの後学習刷新:DeepSeekは0731版が4月プレビューとパラメータ規模・構造が完全に同一であることを明示しています。性能向上は「後学習の再実行のみ」に由来し、「大きい=強い」という前提で評価すると結論が歪みます。
  • Agentスコアは未公開Harnessに強く依存:Terminal Bench 2.0の82.7点(V4-Proプレビュー67.9を上回る)は、DeepSeek自社開発かつ未公開のHarness「minimal mode」で測定。changelogでも「harness選択に極めて敏感」と警告しており、Claude CodeやCursorへの単純移植はできません。
  • API限定でアプリ・Webは未更新:7月31日の更新はAPI公測のみ。コンシューマーアプリとWebチャットは旧版のままです。複数エンドポイントを使うチームは実際のmodel名を確認してください。
  • V4-Pro公式版の日程は未確定:中国メディアが8月10〜20日GAを報じていますが、DeepSeek公式は「できるだけ早く」とのみ記載。4月のV4 GA分析で論じたPro版スケジュールは未確認として扱うべきです。
  • 実運用の不満とベンチマーク叙事のギャップ:21世紀経済報道が引用する海外開発者コミュニティでは、入力キャッシュヒット率の低さやセーフティ分類器のタイムアウトが報告されています。ポストトレーニングだけでは解決できない算力・予算の上限が残ります。

SECTION 02 4月プレビューから7月公式版へ:タイムラインと料金一覧

DeepSeek V4シリーズ主要マイルストーン(2026年8月5日時点)
日付 イベント
2026-04-24 V4プレビュー公開+MITオープンウェイト:V4-Pro(1.6T/49B活性)とV4-Flash(284B/13B活性)、いずれも1Mコンテキスト
2026-07-24 レガシー別名 deepseek-chatdeepseek-reasoner 廃止、全トラフィックをV4ファミリーへ移行
2026-07-27 Moonshot AIがKimi K3(2.8T)の全ウェイトをHugging Faceで公開——DeepSeekへの直接競合圧力
2026-07-31 V4-Flash-0731公式版がAPI公測開始、ウェイト同期公開。changelogで自研Agentフレームワーク「Harness」を初命名
2026-08-05(執筆時) V4-Pro公式版は「できるだけ早く」のまま。アプリ・Webは0731未反映
中国系オープンウェイト旗艦モデル料金比較(100万トークンあたり、ベンダー公表値)
モデル 状態 入力(ミス/ヒット) 出力 ライセンス
DeepSeek-V4-Flash-0731 公式版 $0.14 / $0.0028 $0.28 MIT
DeepSeek-V4-Pro プレビューのみ $0.435 / $0.003625 $0.87 MIT
Kimi K3 ウェイト公開済(7/27) $3.00 / $0.30 $15.00 Kimi K3 License
Qwen3.8-Max API GA(8/2)、ウェイト待ち $2.00 / ~$0.17-0.25 $6.00 オープンウェイト予告

料金はすべてベンダー公表値です。DeepSeekは北京時間9〜12時・14〜18時のピーク2倍 surchargeを予告していますが、発効日は未確定。キャッシュヒット時の入力単価はClaude Opus 4.8の約179分の1になります。

SECTION 03 性能の源泉:アーキテクチャ、Harness、六方向競争

技術報告「DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence」によると、0731版で継承される3つの設計変更は次のとおりです。

  • ハイブリッドアテンション(DSA):圧縮スパースアテンション(CSA)と高度圧縮アテンション(HCA)の組み合わせ。長コンテキスト時の計算・メモリを削減。公式値ではV4-Proは1Mトークン時のFLOPsがV3.2の27%、KV Cacheが10%。
  • 流形制約ハイパーコネクション(mHC):残差接続の改良で学習安定性を向上。
  • Muonオプティマイザ:従来オプティマイザを置き換え収束を加速——性能ジャンプの主因はパラメータ拡大ではなく後学習品質です。

7月31日のchangelogで初めて公式名称が登場したDeepSeek Harnessは、Claude Codeに対抗する自社Agent実行フレームワークです。ファイルI/O、ツール呼び出し、多段階エンジニアリングタスクを担います。これまでDeepSeekモデルは第三者Agentツールに依存してきましたが、公開されたAgentベンチはすべてHarness minimal mode(max推論、top_p=0.95、temperature=1.0)で測定され、フレームワーク自体は未公開です。

第三者Intelligence Indexとタスク単価(Artificial Analysis、金融メディア経由)
モデル ラボ Intelligence Index タスク平均コスト
DeepSeek-V4-Flash-0731 DeepSeek 50 $0.03
Kimi K3 Moonshot AI 57 $0.86
GPT-5.6 Sol OpenAI(クローズド) V4-Flashより9点以上高い $1.86
Claude Fable 5 Anthropic(クローズド) V4-Flashより9点以上高い $3.15

興味深い対比:Artificial Analysisの独立指数ではV4-Flashの知能スコアはKimi K3に劣りますが、タスク単価はK3の約29分の1、Claude Fable 5の約105分の1です。これがOpenRouter 7月ランキングでV4-Flashプレビューが7週連続で呼び出し量首位を維持した理由でもあります。中国開発者コミュニティでは「斬殺線(zhǎn shā xiàn)」と呼ばれる——十分な性能と底値価格の組み合わせが競合の生存ラインを引く、という文脈です。GPT-5.6 Lunaの80%値下げも同じ圧力の表れと読めます。

SECTION 04 V4-Flash-0731導入とAgentコスト管理の7ステップ

  1. model名の移行を確認する:廃止済みの deepseek-chatdeepseek-reasoner を使っている場合は deepseek-v4-flash へ切り替えます。OpenAI ChatCompletions形式やAnthropic形式のAPIではコード変更なしで0731公式版を指します。
  2. 公式料金スナップショットを固定する:入力$0.14/$0.0028(ミス/ヒット)、出力$0.28 per M tokens、ピーク2倍 surcharge予告を記録します。上流の変更は非常に速いです。
  3. トークン単価ではなくタスクコストで試算する:典型Agentパイプライン(計画→ツール→集約)の月間呼び出し量を見積もり、Kimi K3 $3/$15やQwen3.8-Max $2/$6と比較し、Flashの「やや低い知能スコア」を許容する価値があるか判断します。
  4. ベンダー自報と第三者ベンチを分離する:SWE-bench Verifiedなど広く採用された第三者ベンチは信頼度が高い一方、Terminal Bench 2.0は「Harness minimal mode・未公開」と明記し、Claude CodeやCursorでの独立再現を待ちます。
  5. キャッシュヒット率とタイムアウトを監視する:海外開発者報告ではキャッシュヒット率の低さとセーフティ分類器タイムアウトが指摘されています。本番でcache-hit ratioとP99レイテンシを記録し、必要ならKimi K3やQwen3.8-Maxへフォールバックします。
  6. OpenRouterでマルチモデルルーティングを設定する:主経路をV4-Flashでコスト圧縮、複雑推論は高スコアモデルへ。OpenRouter 7月のトラフィックデータでFlashの実運用安定性を検証します。OpenRouterガイドも参照してください。
  7. 高頻度Agentはローカル推論でコスト削減する:API月額がM4物理ノードのレンタルを超える場合、試行錯誤と中小モデル推論をネイティブApple Silicon物理機へ移し、超長コンテキストや旗艦推論のみクラウドAPIに残します。Xcode/iOS CI/CDビルドチェーンは準拠したmacOSハードウェアが必要です。

SECTION 05 引用可能データと一次情報源

  • V4-Flash-0731仕様:284B総量/13B活性、1Mコンテキスト、MIT、2026-07-31公式版
  • Agentスコア(ベンダー+Harness):Terminal Bench 2.0 82.7(V4-Proプレビュー67.9)
  • 第三者Intelligence Index:50点、タスク単価$0.03(Artificial Analysis)
  • 料金:入力$0.14/$0.0028、出力$0.28 per M tokens。キャッシュヒット入力はClaude Opus 4.8の約179分の1
  • 未公開:V4-Pro公式版、DeepSeek Harness——公式は「できるだけ早く」、8月10〜20日は未確認の噂
  • 競合タイムライン:Kimi K3ウェイト7/27、Qwen3.8-Max GA 8/2

公式・独立評価の参照先——上流更新後はリンクを再確認してください:

DeepSeek公式APIドキュメントとchangelog

Hugging Face — DeepSeek-V4-Flashモデルカード

Artificial Analysis — 第三者Intelligence Indexとコストデータ

V4-Flash-0731は極低トークン単価と実用十分なAgent能力でオープンウェイトLLMのコスト曲線を書き換えましたが、Harness依存のスコア、V4-Proの遅延、キャッシュ・タイムアウトなど実運用の課題——この3点が、大規模低コストAgent編成には向く一方、監査可能な旗艦推論には不向きである理由です。いかなるLLM APIもXcodeコンパイル、Metalデバッグ、iOS署名チェーンを代替しません。仮想化macOSはEULAリスクと20〜40%のオーバーヘッドを伴います。実践的な本番パターンは、V4-FlashまたはKimi K3で100万トークンAgent編成を担い、VPSNIX M4/M4 Pro物理ノードでローカルAgent試行、Ollama推論、iOS CI/CDを実行することです——100% Appleハード、フルroot、仮想化タックスなし、日次・月次の弾性課金。料金を確認し、M4クラウドレンタルコストと照合してください。

SECTION 06 よくある質問 FAQ

DeepSeek V4とV3.2の最大の違いは何ですか?

最も直接的な違いはネイティブ1Mトークンコンテキストと、長文時の計算・メモリ大幅削減です(公式:V4-Proは1M時のFLOPsがV3.2の27%、KV Cacheが10%)。加えてAgent能力の専項最適化があり、Claude CodeやOpenCodeなど主要Agentツールに適合しています。

日常利用ではV4 FlashとV4 Proのどちらを選ぶべきですか?

通常の対話、単純タスク、大規模低コスト呼び出し(バッチ処理、Agentパイプライン)ならV4-Flash-0731のコストパフォーマンスが高く、AgentスコアもV4-Proプレビューを上回ります。深い世界知識や複雑推論で予算に余裕がある場合はV4-Proプレビューを使い、公式版公開後に再評価してください。

V4 Pro公式版はもう使えますか?

2026年8月5日時点ではまだです。公式版として稼働しているのはV4-Flash-0731のみで、API限定です。V4-Pro公式版とHarnessは「できるだけ早く」が公式表現で、8月10〜20日は未確認の噂です。

DeepSeekのベンチマーク数値は信頼できますか?

使い分けが必要です。SWE-bench Verifiedなど第三者ベンチは信頼度が比較的高い一方、Terminal Bench 2.0などAgent系は未公開Harnessで測定され、公式もフレームワーク依存を警告しています。Claude CodeやCursorでの独立再現を待つことをお勧めします。

今回の更新は一般開発者にどう影響しますか?

OpenAIまたはAnthropic形式でDeepSeek APIを使っている場合、コード変更は不要で deepseek-v4-flash が0731公式版を指します。廃止済みの deepseek-chatdeepseek-reasoner を使っている場合は7月24日廃止後すぐに新名称へ移行してください。

DeepSeek Harnessとは何ですか?

DeepSeek初の自社Agent実行フレームワークで、Claude Codeに対抗する位置づけです。ファイル編集、ツール呼び出し、多段階エンジニアリングを担います。7月31日changelogで初命名され、まだ公開されていません。公式Agentベンチはすべてこのフレームワークのminimal modeで測定されています。