首頁 / 部落格 / V4 Flash
ENGINEERING_BLOG · 2026.08.05

DeepSeek V4 Flash 正式版:跑分逼近 Opus 4.8、價格僅幾十分之一,Pro 版還要等多久?

V4-FLASH-0731 · TERMINAL BENCH 2.0
82.7

反超 V4-Pro 預覽版 67.9 · 輸入 $0.14/M(快取未命中)· 284B 總參數/13B 啟用 · 2026-07-31 正式版

若你正在為 Agent 流水線或百萬 Token 長文場景選型中國開源大模型,DeepSeek 於 2026 年 7 月 31 日將 V4-Flash 升級為官方正式版(build 0731)是這一週無法略過的事件:參數規模不變(284B 總量/13B 啟用),僅重新後訓練,Agent 跑分卻反超自家 1.6T 的 V4-Pro 預覽版,定價僅為 Claude Opus 4.8 的幾十分之一。本文面向 ML 工程師與技術決策者,梳理時間線、定價矩陣、Harness 框架爭議,以及與 Kimi K3Qwen3.8-Max 的橫向對照。結論先行:V4-Flash-0731 打的是「夠用的智慧+極致價格」,而非跑分第一;官方 V4-Pro 與自研 Harness 仍未上線,生產選型須把「可驗證性」放在榜單分數之前。

SECTION 01 V4-Flash 正式版上線後,五個最常被低估的風險

  • 這不是新模型,是同一架構重跑後訓練:DeepSeek 官方明確說明 0731 版與 4 月預覽版參數規模、模型結構完全相同,效能提升「完全來自重新進行的後訓練」——若你的評估基於「更大=更強」直覺,結論可能失真。
  • Agent 跑分高度依賴未公開的 Harness:Terminal Bench 2.0 的 82.7 分(反超 V4-Pro 預覽版 67.9)全部基於 DeepSeek 自研且尚未公開的 Harness「極簡模式」測得;官方 changelog 主動提示「跑分對 harness 選擇非常敏感」,不宜直接橫向套用到 Claude Code、Cursor 等框架。
  • 僅限 API,App 與網頁端未同步:7 月 31 日更新僅覆蓋 API 公測,消費者 App 與網頁聊天仍為舊版——若團隊混用多端入口,須確認實際路由的 model 名稱。
  • V4-Pro 官方版時間仍不確定:多家媒體援引未署名消息源稱 8 月 10–20 日 GA,但 DeepSeek 官方僅說「將盡快發布」——四月 V4 GA 分析中討論的 Pro 檔位時程表須按「未證實」規劃。
  • 實際可用性與跑分敘事存在落差:據 21 世紀經濟報導援引海外開發者回饋,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題——算力與參數儲備仍是能力上限的現實瓶頸。

SECTION 02 從 4 月預覽到 7 月正式版:時間線與核心定價

DeepSeek V4 系列關鍵里程碑(截至 2026-08-05)
日期 事件
2026-04-24 V4 預覽版首次發布並開源(MIT):V4-Pro(1.6T/49B 啟用)與 V4-Flash(284B/13B 啟用),均支援 100 萬 Token 上下文
2026-07-24 舊介面 deepseek-chatdeepseek-reasoner 正式停用,全部流量切換至 V4 系列命名
2026-07-27 月之暗面 Kimi K3(2.8T)開源權重上線 Hugging Face,對 DeepSeek 形成直接競爭壓力
2026-07-31 V4-Flash-0731 正式版進入 API 公測,開源權重同步上線;changelog 首次點名自研 Agent 框架「Harness」,稱即將隨 V4 正式版發布
2026-08-05(撰稿時) V4-Pro 官方版仍為「盡快發布」,無官方確認日期;App/網頁端尚未同步 0731 版
中國開源旗艦模型定價對照(每百萬 Token,廠商自報)
模型 狀態 輸入(快取未命中/命中) 輸出 授權
DeepSeek-V4-Flash-0731 官方正式版 $0.14 / $0.0028 $0.28 MIT
DeepSeek-V4-Pro 預覽版(官方版未發布) $0.435 / $0.003625 $0.87 MIT
Kimi K3 權重開源(2026-07-27) $3.00 / $0.30 $15.00 Kimi K3 License
Qwen3.8-Max API GA(2026-08-02),權重待釋出 $2.00 / ~$0.17–0.25 $6.00 承諾開源,尚未釋出權重

定價均為廠商自報;DeepSeek 已預告未來高峰時段(北京時間 9–12 點、14–18 點)2 倍加價,截至撰稿尚未公布生效日期。快取命中時 V4-Flash 輸入價約為 Claude Opus 4.8 的 1/179。

SECTION 03 效能怎麼「變出來」:架構、Harness 與六邊形混戰

根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構上的三處關鍵改動在 0731 版中延續不變:

  • 混合注意力(DSA 稀疏注意力):結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),降低長上下文場景的運算與顯存開銷;官方稱 V4-Pro 在百萬 Token 下所需 FLOPs 僅為 V3.2 的 27%,KV Cache 僅 10%。
  • 流形約束超連接(mHC):對傳統殘差連接結構的改進,提升訓練穩定性。
  • Muon 優化器:替換傳統優化器,加速收斂——效能躍升主要來自後訓練資料品質與方法,而非堆參數。

7 月 31 日 changelog 首次正式出現 DeepSeek Harness——自研 Agent 執行框架,對標 Claude Code,用於檔案讀寫、工具呼叫與端到端工程任務。在此之前 DeepSeek 模型主要依賴第三方 Agent 工具;官方 Agent 跑分全部用 Harness「極簡模式」(max 檔位、top_p=0.95、temperature=1.0)測得,且框架尚未公開。

第三方 Intelligence Index 與單任務成本(Artificial Analysis,經財經媒體轉引)
模型 實驗室 Intelligence Index 單任務平均成本
DeepSeek-V4-Flash-0731 DeepSeek 50 $0.03
Kimi K3 月之暗面 57 $0.86
GPT-5.6 Sol OpenAI(閉源) 比 V4-Flash 高 9 分以上 $1.86
Claude Fable 5 Anthropic(閉源) 比 V4-Flash 高 9 分以上 $3.15

有趣的反差:在 Artificial Analysis 第三方指數上,V4-Flash 智慧分並非最高,甚至落後 Kimi K3;但單任務成本僅為 K3 的約 1/29、Claude Fable 5 的約 1/105。這也解釋了為何 V4-Flash 預覽版能在 OpenRouter 7 月排行榜連續七週穩坐呼叫量第一——目標使用者是需要大規模呼叫、對絕對智慧上限不那麼敏感的 Agent 與批次任務場景。中文開發者社群將此稱為「斬殺線」:夠用的效能加極端低價,給同行設下一條生存門檻,也促使 GPT-5.6 Luna 一次性降價 80% 等競品密集調價。

SECTION 04 V4-Flash-0731 接入與 Agent 成本控管七步實作

  1. 確認 model 名稱已遷移:若仍使用已停用的 deepseek-chatdeepseek-reasoner,須切換至 deepseek-v4-flash;OpenAI ChatCompletions 或 Anthropic 格式接入無需改程式碼,model 名會自動指向 0731 正式版。
  2. 鎖定官方定價快照:記錄輸入 $0.14/$0.0028(快取未命中/命中)、輸出 $0.28 每百萬 Token,以及高峰 2 倍加價預告——上游政策變動極快。
  3. 用任務成本而非 Token 單價試算:以典型 Agent 流水線(規劃→工具呼叫→彙總)估算月呼叫量;對比 Kimi K3 $3/$15 與 Qwen3.8-Max $2/$6,確認 Flash 是否值得為極致成本付「智慧分略低」的代價。
  4. 區分廠商自報與第三方基準:SWE-bench Verified 等廣泛採用的第三方基準可信度較高;Terminal Bench 2.0 等 Agent 類跑分須標註「Harness 極簡模式、尚未公開」,等社群用 Claude Code、Cursor 獨立複現後再下結論。
  5. 監控快取命中率與逾時:依海外開發者回饋,正式版存在快取命中率偏低與安全分類器逾時——在生產環境記錄 cache-hit ratio 與 P99 延遲,必要時設定 Fallback 至 Kimi K3 或 Qwen3.8-Max。
  6. 在 OpenRouter 設多模型路由:主路由 V4-Flash 壓低成本,備援高智慧分模型應對複雜推理;參考 OpenRouter 7 月流量資料驗證 Flash 在真實 Agent 場景的穩定性。
  7. 高頻 Agent 本地推理降本:當 API 月帳單超過 M4 實體節點租賃成本時,將試錯與中小模型推理遷到原生 Apple Silicon 裸機,僅把超長上下文或旗艦推理留給雲端 API——Xcode/iOS CI/CD 建置鏈仍須留在合規 macOS 硬體上。

SECTION 05 可引用資料與權威來源

  • V4-Flash-0731 規格:284B 總參數/13B 啟用、100 萬 Token 上下文、MIT 開源、2026-07-31 正式版
  • Agent 跑分(廠商自報+Harness):Terminal Bench 2.0 82.7(V4-Pro 預覽版 67.9)
  • 第三方 Intelligence Index:50 分、單任務成本 $0.03(Artificial Analysis)
  • 定價:輸入 $0.14/$0.0028、輸出 $0.28 每百萬 Token;較 Claude Opus 4.8 快取命中輸入約便宜 179 倍
  • 未上線:V4-Pro 官方版、DeepSeek Harness 框架——官方口徑「盡快發布」,8 月 10–20 日為未證實傳言
  • 競品時間軸:Kimi K3 權重 2026-07-27;Qwen3.8-Max GA 2026-08-02

以下連結請在發版或上游更新後再次開啟核對:

DeepSeek 官方 API 文件與更新日誌

Hugging Face — DeepSeek-V4-Flash 模型卡

Artificial Analysis — 第三方模型 Intelligence Index 與成本資料

V4-Flash-0731 以極低 Token 單價與夠用的 Agent 能力改寫了開源模型性價比曲線,但Harness 依賴的跑分、V4-Pro 跳票、快取與逾時等實際可用性問題——這三點決定了它更適合「大規模低成本 Agent 編排」而非「可審計的旗艦推理」。純 API 方案也無法取代 Xcode 編譯、Metal 除錯與 iOS 簽章鏈;在 macOS 上跑虛擬化環境有 EULA 紅線且常見 20–40% 效能損耗。務實組合是:V4-Flash 或 Kimi K3 負責百萬上下文 Agent 編排,VPSNIX M4/M4 Pro 雲端裸機 Mac負責本地 Agent 試錯、Ollama 推理與 iOS CI/CD——100% 蘋果原裝硬體、完整 Root 權限、零 Hypervisor 損耗、按天/月彈性下單。當 DeepSeek API 帳單持續攀升時,把反覆試錯的 Agent 迴圈遷到實體節點往往比繼續堆 API 配額更划算。詳見定價頁,並對照雲 Mac 租賃成本框架

SECTION 06 常見問題 FAQ

DeepSeek V4 和 V3.2 最大的差別是什麼?

最直接的是原生支援 100 萬 Token 上下文,且長上下文場景下運算與顯存開銷大幅降低(官方資料:V4-Pro 在百萬 Token 下所需 FLOPs 僅為 V3.2 的 27%,KV Cache 僅 10%)。此外 V4 系列在 Agent 能力上做了專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。

日常應該選 V4 Flash 還是 V4 Pro?

若為普通對話、簡單任務或需要大規模低成本呼叫(批次處理、Agent 流水線),V4-Flash-0731 正式版性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。若任務涉及更深的世界知識或複雜推理且預算不敏感,可先用 V4-Pro 預覽版,等官方版上線後再評估是否切換。

現在能用上 V4 Pro 官方版嗎?

截至 2026 年 8 月 5 日還不能。目前上線的官方版僅 V4-Flash-0731,且僅限 API 呼叫。V4-Pro 官方版與 Harness 框架官方口徑是「盡快發布」,網上流傳的 8 月 10–20 日為未經證實的傳言。

DeepSeek 公布的跑分能直接相信嗎?

建議區分對待。SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 類跑分用自研且未公開的 Harness 測得,官方也提示對框架選擇高度敏感——建議等社群用 Claude Code、Cursor 等獨立複現後再下結論。

這次更新對一般開發者有什麼實際影響?

若用 OpenAI 或 Anthropic 格式 API 接入 DeepSeek,無需改程式碼,deepseek-v4-flash 會自動指向 0731 正式版。若仍使用已停用的 deepseek-chatdeepseek-reasoner,須在 7 月 24 日停用後盡快切換新命名。

什麼是 DeepSeek Harness?

DeepSeek 首次自研的 Agent 執行框架,對標 Claude Code,用於檔案編輯、工具呼叫與多步驟工程任務。7 月 31 日 changelog 首次點名,尚未公開發布;官方 Agent 跑分均以此框架的「極簡模式」測得。