若你正在為 Agent 流水線或百萬 Token 長文場景選型中國開源大模型,DeepSeek 於 2026 年 7 月 31 日將 V4-Flash 升級為官方正式版(build 0731)是這一週無法略過的事件:參數規模不變(284B 總量/13B 啟用),僅重新後訓練,Agent 跑分卻反超自家 1.6T 的 V4-Pro 預覽版,定價僅為 Claude Opus 4.8 的幾十分之一。本文面向 ML 工程師與技術決策者,梳理時間線、定價矩陣、Harness 框架爭議,以及與 Kimi K3、Qwen3.8-Max 的橫向對照。結論先行:V4-Flash-0731 打的是「夠用的智慧+極致價格」,而非跑分第一;官方 V4-Pro 與自研 Harness 仍未上線,生產選型須把「可驗證性」放在榜單分數之前。
SECTION 01 V4-Flash 正式版上線後,五個最常被低估的風險
- 這不是新模型,是同一架構重跑後訓練:DeepSeek 官方明確說明 0731 版與 4 月預覽版參數規模、模型結構完全相同,效能提升「完全來自重新進行的後訓練」——若你的評估基於「更大=更強」直覺,結論可能失真。
- Agent 跑分高度依賴未公開的 Harness:Terminal Bench 2.0 的 82.7 分(反超 V4-Pro 預覽版 67.9)全部基於 DeepSeek 自研且尚未公開的 Harness「極簡模式」測得;官方 changelog 主動提示「跑分對 harness 選擇非常敏感」,不宜直接橫向套用到 Claude Code、Cursor 等框架。
- 僅限 API,App 與網頁端未同步:7 月 31 日更新僅覆蓋 API 公測,消費者 App 與網頁聊天仍為舊版——若團隊混用多端入口,須確認實際路由的 model 名稱。
- V4-Pro 官方版時間仍不確定:多家媒體援引未署名消息源稱 8 月 10–20 日 GA,但 DeepSeek 官方僅說「將盡快發布」——四月 V4 GA 分析中討論的 Pro 檔位時程表須按「未證實」規劃。
- 實際可用性與跑分敘事存在落差:據 21 世紀經濟報導援引海外開發者回饋,正式版存在輸入快取命中率偏低、安全分類器偶發逾時等問題——算力與參數儲備仍是能力上限的現實瓶頸。
SECTION 02 從 4 月預覽到 7 月正式版:時間線與核心定價
| 日期 | 事件 |
|---|---|
| 2026-04-24 | V4 預覽版首次發布並開源(MIT):V4-Pro(1.6T/49B 啟用)與 V4-Flash(284B/13B 啟用),均支援 100 萬 Token 上下文 |
| 2026-07-24 | 舊介面 deepseek-chat、deepseek-reasoner 正式停用,全部流量切換至 V4 系列命名 |
| 2026-07-27 | 月之暗面 Kimi K3(2.8T)開源權重上線 Hugging Face,對 DeepSeek 形成直接競爭壓力 |
| 2026-07-31 | V4-Flash-0731 正式版進入 API 公測,開源權重同步上線;changelog 首次點名自研 Agent 框架「Harness」,稱即將隨 V4 正式版發布 |
| 2026-08-05(撰稿時) | V4-Pro 官方版仍為「盡快發布」,無官方確認日期;App/網頁端尚未同步 0731 版 |
| 模型 | 狀態 | 輸入(快取未命中/命中) | 輸出 | 授權 |
|---|---|---|---|---|
| DeepSeek-V4-Flash-0731 | 官方正式版 | $0.14 / $0.0028 | $0.28 | MIT |
| DeepSeek-V4-Pro | 預覽版(官方版未發布) | $0.435 / $0.003625 | $0.87 | MIT |
| Kimi K3 | 權重開源(2026-07-27) | $3.00 / $0.30 | $15.00 | Kimi K3 License |
| Qwen3.8-Max | API GA(2026-08-02),權重待釋出 | $2.00 / ~$0.17–0.25 | $6.00 | 承諾開源,尚未釋出權重 |
定價均為廠商自報;DeepSeek 已預告未來高峰時段(北京時間 9–12 點、14–18 點)2 倍加價,截至撰稿尚未公布生效日期。快取命中時 V4-Flash 輸入價約為 Claude Opus 4.8 的 1/179。
SECTION 03 效能怎麼「變出來」:架構、Harness 與六邊形混戰
根據技術報告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列架構上的三處關鍵改動在 0731 版中延續不變:
- 混合注意力(DSA 稀疏注意力):結合壓縮稀疏注意力(CSA)與高度壓縮注意力(HCA),降低長上下文場景的運算與顯存開銷;官方稱 V4-Pro 在百萬 Token 下所需 FLOPs 僅為 V3.2 的 27%,KV Cache 僅 10%。
- 流形約束超連接(mHC):對傳統殘差連接結構的改進,提升訓練穩定性。
- Muon 優化器:替換傳統優化器,加速收斂——效能躍升主要來自後訓練資料品質與方法,而非堆參數。
7 月 31 日 changelog 首次正式出現 DeepSeek Harness——自研 Agent 執行框架,對標 Claude Code,用於檔案讀寫、工具呼叫與端到端工程任務。在此之前 DeepSeek 模型主要依賴第三方 Agent 工具;官方 Agent 跑分全部用 Harness「極簡模式」(max 檔位、top_p=0.95、temperature=1.0)測得,且框架尚未公開。
| 模型 | 實驗室 | Intelligence Index | 單任務平均成本 |
|---|---|---|---|
| DeepSeek-V4-Flash-0731 | DeepSeek | 50 | $0.03 |
| Kimi K3 | 月之暗面 | 57 | $0.86 |
| GPT-5.6 Sol | OpenAI(閉源) | 比 V4-Flash 高 9 分以上 | $1.86 |
| Claude Fable 5 | Anthropic(閉源) | 比 V4-Flash 高 9 分以上 | $3.15 |
有趣的反差:在 Artificial Analysis 第三方指數上,V4-Flash 智慧分並非最高,甚至落後 Kimi K3;但單任務成本僅為 K3 的約 1/29、Claude Fable 5 的約 1/105。這也解釋了為何 V4-Flash 預覽版能在 OpenRouter 7 月排行榜連續七週穩坐呼叫量第一——目標使用者是需要大規模呼叫、對絕對智慧上限不那麼敏感的 Agent 與批次任務場景。中文開發者社群將此稱為「斬殺線」:夠用的效能加極端低價,給同行設下一條生存門檻,也促使 GPT-5.6 Luna 一次性降價 80% 等競品密集調價。
SECTION 04 V4-Flash-0731 接入與 Agent 成本控管七步實作
- 確認 model 名稱已遷移:若仍使用已停用的
deepseek-chat/deepseek-reasoner,須切換至deepseek-v4-flash;OpenAI ChatCompletions 或 Anthropic 格式接入無需改程式碼,model 名會自動指向 0731 正式版。 - 鎖定官方定價快照:記錄輸入 $0.14/$0.0028(快取未命中/命中)、輸出 $0.28 每百萬 Token,以及高峰 2 倍加價預告——上游政策變動極快。
- 用任務成本而非 Token 單價試算:以典型 Agent 流水線(規劃→工具呼叫→彙總)估算月呼叫量;對比 Kimi K3 $3/$15 與 Qwen3.8-Max $2/$6,確認 Flash 是否值得為極致成本付「智慧分略低」的代價。
- 區分廠商自報與第三方基準:SWE-bench Verified 等廣泛採用的第三方基準可信度較高;Terminal Bench 2.0 等 Agent 類跑分須標註「Harness 極簡模式、尚未公開」,等社群用 Claude Code、Cursor 獨立複現後再下結論。
- 監控快取命中率與逾時:依海外開發者回饋,正式版存在快取命中率偏低與安全分類器逾時——在生產環境記錄 cache-hit ratio 與 P99 延遲,必要時設定 Fallback 至 Kimi K3 或 Qwen3.8-Max。
- 在 OpenRouter 設多模型路由:主路由 V4-Flash 壓低成本,備援高智慧分模型應對複雜推理;參考 OpenRouter 7 月流量資料驗證 Flash 在真實 Agent 場景的穩定性。
- 高頻 Agent 本地推理降本:當 API 月帳單超過 M4 實體節點租賃成本時,將試錯與中小模型推理遷到原生 Apple Silicon 裸機,僅把超長上下文或旗艦推理留給雲端 API——Xcode/iOS CI/CD 建置鏈仍須留在合規 macOS 硬體上。
SECTION 05 可引用資料與權威來源
- V4-Flash-0731 規格:284B 總參數/13B 啟用、100 萬 Token 上下文、MIT 開源、2026-07-31 正式版
- Agent 跑分(廠商自報+Harness):Terminal Bench 2.0 82.7(V4-Pro 預覽版 67.9)
- 第三方 Intelligence Index:50 分、單任務成本 $0.03(Artificial Analysis)
- 定價:輸入 $0.14/$0.0028、輸出 $0.28 每百萬 Token;較 Claude Opus 4.8 快取命中輸入約便宜 179 倍
- 未上線:V4-Pro 官方版、DeepSeek Harness 框架——官方口徑「盡快發布」,8 月 10–20 日為未證實傳言
- 競品時間軸:Kimi K3 權重 2026-07-27;Qwen3.8-Max GA 2026-08-02
以下連結請在發版或上游更新後再次開啟核對:
Hugging Face — DeepSeek-V4-Flash 模型卡
Artificial Analysis — 第三方模型 Intelligence Index 與成本資料
V4-Flash-0731 以極低 Token 單價與夠用的 Agent 能力改寫了開源模型性價比曲線,但Harness 依賴的跑分、V4-Pro 跳票、快取與逾時等實際可用性問題——這三點決定了它更適合「大規模低成本 Agent 編排」而非「可審計的旗艦推理」。純 API 方案也無法取代 Xcode 編譯、Metal 除錯與 iOS 簽章鏈;在 macOS 上跑虛擬化環境有 EULA 紅線且常見 20–40% 效能損耗。務實組合是:V4-Flash 或 Kimi K3 負責百萬上下文 Agent 編排,VPSNIX M4/M4 Pro 雲端裸機 Mac負責本地 Agent 試錯、Ollama 推理與 iOS CI/CD——100% 蘋果原裝硬體、完整 Root 權限、零 Hypervisor 損耗、按天/月彈性下單。當 DeepSeek API 帳單持續攀升時,把反覆試錯的 Agent 迴圈遷到實體節點往往比繼續堆 API 配額更划算。詳見定價頁,並對照雲 Mac 租賃成本框架。
SECTION 06 常見問題 FAQ
DeepSeek V4 和 V3.2 最大的差別是什麼?
最直接的是原生支援 100 萬 Token 上下文,且長上下文場景下運算與顯存開銷大幅降低(官方資料:V4-Pro 在百萬 Token 下所需 FLOPs 僅為 V3.2 的 27%,KV Cache 僅 10%)。此外 V4 系列在 Agent 能力上做了專項優化,適配 Claude Code、OpenCode 等主流 Agent 工具。
日常應該選 V4 Flash 還是 V4 Pro?
若為普通對話、簡單任務或需要大規模低成本呼叫(批次處理、Agent 流水線),V4-Flash-0731 正式版性價比更高,且 Agent 跑分已反超 V4-Pro 預覽版。若任務涉及更深的世界知識或複雜推理且預算不敏感,可先用 V4-Pro 預覽版,等官方版上線後再評估是否切換。
現在能用上 V4 Pro 官方版嗎?
截至 2026 年 8 月 5 日還不能。目前上線的官方版僅 V4-Flash-0731,且僅限 API 呼叫。V4-Pro 官方版與 Harness 框架官方口徑是「盡快發布」,網上流傳的 8 月 10–20 日為未經證實的傳言。
DeepSeek 公布的跑分能直接相信嗎?
建議區分對待。SWE-bench Verified 等第三方基準可信度較高;Terminal Bench 2.0 等 Agent 類跑分用自研且未公開的 Harness 測得,官方也提示對框架選擇高度敏感——建議等社群用 Claude Code、Cursor 等獨立複現後再下結論。
這次更新對一般開發者有什麼實際影響?
若用 OpenAI 或 Anthropic 格式 API 接入 DeepSeek,無需改程式碼,deepseek-v4-flash 會自動指向 0731 正式版。若仍使用已停用的 deepseek-chat/deepseek-reasoner,須在 7 月 24 日停用後盡快切換新命名。
什麼是 DeepSeek Harness?
DeepSeek 首次自研的 Agent 執行框架,對標 Claude Code,用於檔案編輯、工具呼叫與多步驟工程任務。7 月 31 日 changelog 首次點名,尚未公開發布;官方 Agent 跑分均以此框架的「極簡模式」測得。