首页 / 博客 / V4 Flash
ENGINEERING_BLOG · 2026.08.05

DeepSeek V4 Flash正式版上线:跑分逼近Opus 4.8,价格却只要几十分之一,Pro版还要再等等

DEEPSEEK V4-FLASH · TERMINAL BENCH 2.0
82.7

反超 V4-Pro 预览版 67.9 分;基于自研 Harness 极简模式测得(厂商自报,2026-07-31)

如果你在 2026 年 8 月评估国产开源大模型的 Agent 性价比,DeepSeek V4-Flash-0731 正式版是绕不开的名字。7 月 31 日,DeepSeek 将同一套 284B 参数模型重新后训练后推为官方版:跑分反超更大的 V4-Pro 预览版,API 价格仅为 Claude Opus 4.8 的几十分之一——但旗舰 V4-Pro 官方版与自研 Agent 框架 Harness 仍未上线。本文梳理从 4 月预览到 7 月正式版的三个月时间线、核心定价与竞品对比矩阵,拆解跑分背后的 Harness 依赖与四个争议点,并给出六步接入清单。

SECTION 01 DeepSeek V4 Flash 正式版上线前,开发者最该警惕的四个信号

这不是一次新模型发布,而是同一个 284B 参数模型重新做了一遍后训练。把版本迭代放进三个月时间线,比单看一张跑分表更能判断风险。

  • 跑分方法依赖 Harness,官方自己都在提醒别只看数字:V4-Flash-0731 公布的 Agent 类跑分(Terminal Bench 2.0 拿到 82.7 分)全部基于 DeepSeek 自研且尚未公开发布的 Harness 极简模式测得。在独立社区复现之前,这组数字应被视为「厂商自报+特定框架」结果,而非可以直接横向套用到 Claude Code、Cursor 等框架上的通用能力。
  • 海外开发者反馈了具体的可用性问题:据 21 世纪经济报道援引的海外开发者社区反馈,V4-Flash 正式版存在输入缓存命中率偏低、安全分类器偶发超时等问题,和「跑分暴涨」的营销叙事形成一定反差。
  • V4-Pro 官方版和 Harness 上线时间未经证实:多家中文媒体报道「内部测试」和「8 月 10–20 日 GA」等具体窗口,但 DeepSeek 官方 changelog 的原话只是「将尽快发布」,没有给出确切日期——读者应以此为准,不要把猜测当成官方计划。
  • 企业融资与 IPO 传闻同样需要谨慎对待:多家媒体报道 DeepSeek 近期完成约 74 亿美元融资、估值约 487 亿美元等信息,目前主要来自财经媒体的「据报道」「消息人士称」,尚无 DeepSeek 官方或监管备案文件的直接确认。

时间线速览:

  • 2026 年 4 月 24 日 — DeepSeek-V4 预览版首次发布并开源,包含 V4-Pro(1.6T/49B)和 V4-Flash(284B/13B),均支持 100 万 token 上下文,MIT 协议。
  • 7 月 24 日 — 旧接口 deepseek-chatdeepseek-reasoner 正式停用,全部流量切换到 V4 系列命名。详见DeepSeek V4 GA 发布解读
  • 7 月 27 日月之暗面 Kimi K3(2.8T 总参数)开源权重上线 Hugging Face,给 DeepSeek 制造了不小的竞争压力。
  • 7 月 31 日 — DeepSeek-V4-Flash-0731 正式版进入 API 公测,开源权重同步上线 Hugging Face;changelog 首次点名自研 Agent 框架 Harness,称即将随 V4 正式版一起发布。此次公测仅限 API,App 和网页端暂未同步更新。
  • 截至 2026 年 8 月 5 日 — V4-Pro 官方版仍是「尽快发布」;阿里 Qwen3.8-Max于 8 月 3 日 GA,国产万亿参数大战进入新回合。

SECTION 02 DeepSeek V4 Flash 核心规格与定价数据对照

以下定价均为 DeepSeek、Moonshot、阿里等官方公开数据,属于「厂商自报」信息。DeepSeek 已预告未来将对 API 启用「高峰时段 2 倍加价」(北京时间 9–12 点、14–18 点),但截至发稿未公布具体生效日期。

DeepSeek V4 系列与竞品核心数据一览
模型 状态 总/激活参数 输入价(缓存未命中/命中) 输出价 协议
DeepSeek-V4-Flash-0731 官方正式版(07-31) 284B / 13B $0.14 / $0.0028 $0.28 MIT
DeepSeek-V4-Pro 预览版(04-24,官方版未发布) 1.6T / 49B $0.435 / $0.003625 $0.87 MIT
Kimi K3 权重开源(07-27) 2.8T / 约 104B(社区估算) $3.00 / $0.30 $15.00 Kimi K3 License
GLM-5.2 开源(2026 年 6 月) ~744B / ~40B 未在本文核实范围内 未在本文核实范围内 MIT
Qwen3.8-Max API 可用(08-02),权重待放出 2.4T / 95B $2.00 / ~$0.17–0.25 $6.00 承诺开源,尚未放出

284B 总参数、13B 激活参数的 Flash 版本,在多项 Agent 基准上反而超过了参数量是自己好几倍的 V4-Pro 预览版——2026 年下半年大模型竞争,后训练数据质量的重要性正在逼近甚至超过单纯堆参数。

SECTION 03 架构没变、后训练变了:混合注意力与 Harness 框架拆解

V4-Flash-0731 在参数规模、模型结构上和 4 月预览版完全相同,DeepSeek 官方明确说明性能提升「完全来自重新进行的后训练」,而非扩大模型规模。根据技术报告《DeepSeek-V4: Towards Highly Efficient Million-Token Context Intelligence》,V4 系列在架构上做了三处关键改动:

  • 混合注意力架构:结合压缩稀疏注意力(CSA)与高度压缩注意力(HCA),官方对外统一称为「DSA 稀疏注意力」,核心目的是在长上下文场景下降低计算和显存开销。
  • 流形约束超连接(mHC):对传统残差连接结构做了改进。
  • Muon 优化器:替换传统优化器,用于提升训练收敛速度和稳定性。官方数据:V4-Pro 在百万 token 上下文下所需 FLOPs 仅为 V3.2 的 27%,KV Cache 占用仅为 10%。

7 月 31 日的 changelog 里第一次正式出现 DeepSeek Harness——这是 DeepSeek 自研的 Agent 执行框架,用于让模型读写文件、调用工具、执行命令、完成端到端的工程任务,对标 Claude Code。官方公开的 Agent 跑分(Terminal Bench 2.0、Toolathlon 等)全部是用 Harness 的「极简模式」(minimal mode)测出来的,DeepSeek 在 changelog 里也主动提示:「跑分对 harness(执行框架)的选择非常敏感,不能简单等同于模型本身能力的提升」。

更值得关注的是中文开发者社区流传的「斩杀线」说法:DeepSeek 凭借「够用的性能 + 极端低价」的组合,给同行设下了一条门槛——这也解释了近期GPT-5.6 Luna 一次性降价 80%等密集定价调整。V4-Flash 正式版上线当天(7 月 31 日),英伟达、博通、AMD 等算力芯片股并未出现明显波动——市场似乎已经习惯了「DeepSeek 式效率突破」这种叙事。

SECTION 04 DeepSeek V4 Flash vs Kimi K3 vs Qwen3.8-Max:横向对比矩阵

DeepSeek-V4-Flash 的这次更新,恰好卡在中国大模型开源阵营最密集的窗口期。Intelligence Index 与单任务成本数据引自 Artificial Analysis(第三方独立评测);DeepSeek 官方跑分为厂商自报,两组数据评测方法不完全一致,分开列出。

旗舰与开源模型横向对比(2026 年 8 月初公开数据)
模型 实验室 总参数 Intelligence Index 单任务平均成本
DeepSeek-V4-Flash-0731 DeepSeek 284B 50 $0.03
Kimi K3 月之暗面 2.8T 57 $0.86
GLM-5.2 智谱/Z.ai ~744B 比 V4-Flash 高约 1 分 未在本次调研范围内核实
Qwen3.8-Max 阿里 2.4T 未在本次调研范围内核实 未在本次调研范围内核实
GPT-5.6 Sol OpenAI 未公开 比 V4-Flash 高 9 分以上 $1.86
Claude Fable 5 Anthropic 未公开 比 V4-Flash 高 9 分以上 $3.15

在 Artificial Analysis 第三方综合指数上,V4-Flash 的「智能分」其实不是最高的,甚至落后于 Kimi K3 和 GLM-5.2;但它的单任务成本只有 Kimi K3 的约 1/29、GPT-5.6 Sol 的约 1/62、Claude Fable 5 的约 1/105。DeepSeek 这次打的不是「跑分第一」,而是「够用的智能 + 极致的价格」——V4-Flash 预览版曾在 OpenRouter 上连续七周稳坐调用量第一。

SECTION 05 DeepSeek V4 Flash 正式版发布后的六步评估与接入清单

  1. 确认旧接口已迁移:若仍在使用已停用的 deepseek-chatdeepseek-reasoner,须尽快切换到 deepseek-v4-flash 新命名;OpenAI ChatCompletions 或 Anthropic 格式接入无需改代码,model 名会自动指向官方版本。
  2. 区分 Flash 与 Pro 的适用场景:普通对话、批量处理、Agent 流水线优先选 V4-Flash-0731(性价比更高且 Agent 跑分已反超 V4-Pro 预览版);更深世界知识或复杂推理可暂用 V4-Pro 预览版,等官方版上线后再评估切换。
  3. 核对缓存命中与高峰计费:正式版存在输入缓存命中率偏低的社区反馈;同时 DeepSeek 已预告高峰时段 2 倍加价(北京时间 9–12 点、14–18 点),24/7 流水线须做调度规划。
  4. 对 Harness 跑分保持审慎:Terminal Bench 2.0 等 Agent 类跑分基于未公开的 Harness 极简模式(max 档位、top_p=0.95、temperature=1.0),建议在自己的业务场景用 Claude Code、Cursor 等框架做 A/B,勿仅凭厂商表格迁移生产系统。
  5. 横向比价 Kimi K3 与 Qwen3.8-Max:若需要已验证的开源权重与更高 Intelligence Index,Kimi K3 更成熟;若追求极致 API 单价与大规模 Agent 调用,V4-Flash 有压倒性价格优势。
  6. 关注 V4-Pro 官方版与 Harness 上线动态:截至 8 月 5 日尚无官方确认日期;网上流传的「8 月 10–20 日」等窗口未经证实,以 DeepSeek 官方 changelog 为准。

SECTION 06 可引用技术数据与权威来源

  • Terminal Bench 2.0(厂商自报):82.7 分,反超 V4-Pro 预览版 67.9 分;基于 Harness 极简模式测得
  • 百万 token 上下文效率(官方技术报告):V4-Pro 相比 V3.2,单 token 推理 FLOPs 仅为 27%,KV Cache 占用仅为 10%
  • Artificial Analysis Intelligence Index:V4-Flash 50 分,Kimi K3 57 分,GPT-5.6 Sol 与 Claude Fable 5 均高 9 分以上
  • 单任务平均成本(Artificial Analysis):V4-Flash $0.03,Kimi K3 $0.86,GPT-5.6 Sol $1.86,Claude Fable 5 $3.15
  • 价格对比 Claude Opus 4.8(据 21 世纪经济报道):缓存未命中输入约便宜 36 倍,缓存命中输入约便宜 179 倍,输出约便宜 89 倍
  • 开源状态:V4-Flash-0731 权重已于 7 月 31 日同步上线 Hugging Face,MIT 协议

以下链接请在发版或上游更新后再次打开核对:

DeepSeek 官方 API 文档与更新日志

Hugging Face — DeepSeek-V4-Flash 模型卡与开源权重

Artificial Analysis — 第三方模型 Intelligence Index 与成本评测

纯 API 调用看似便宜,但Harness 跑分难以复现、缓存命中率不稳定、V4-Pro 与 Harness 仍未公开——在需要反复试 prompt、联调 Agent 工具链、对比 Kimi K3 与 Qwen 路由的生产环境里,成本与稳定性往往比 headline 跑分更重要。对于需要零损耗原生算力、在 Mac 上本地跑量化模型做 A/B、同时稳定 iOS CI/CD 与 AI Agent 自动化的团队,VPSNIX 的云端物理节点通常是更优解——100% 苹果原装物理机、完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。结合Mac mini M4 云租赁全解析定价页评估双栈方案。

SECTION 07 常见问题 FAQ

DeepSeek V4 和之前的 V3.2 相比,最大的区别是什么?

最直接的区别是原生支持 100 万 token 上下文,且长上下文场景下的计算和显存开销大幅降低(官方数据:V4-Pro 在百万 token 上下文下所需 FLOPs 仅为 V3.2 的 27%,KV Cache 仅为 10%)。此外 V4 系列在 Agent 能力上做了专项优化,适配了 Claude Code、OpenCode 等主流 Agent 工具。

日常使用应该选 V4 Flash 还是 V4 Pro?

如果只是普通对话、简单任务或者需要大规模、低成本调用(比如批量处理、Agent 流水线),目前的 V4-Flash-0731 官方版性价比更高,且 Agent 跑分已经反超 V4-Pro 预览版。如果任务涉及更深的世界知识或复杂推理,且预算不敏感,可以先用 V4-Pro 预览版,等官方版上线后再评估是否需要切换。

现在能用上 V4 Pro 官方版吗?

截至本文发稿(2026 年 8 月 5 日),还不能。目前上线的官方版只有 V4-Flash-0731,且仅限 API 调用,App 和网页端还是旧版本。V4-Pro 官方版和自研 Harness 框架官方口径是「尽快发布」,没有确切上线日期,网上流传的「8 月 10–20 日」等具体时间是未经证实的传言。

DeepSeek 公布的跑分能直接相信吗?

建议区分对待。像 SWE-bench Verified 这类被广泛采用、方法论透明的第三方基准,可信度相对较高;但 Terminal Bench 2.0 等 Agent 类跑分是用 DeepSeek 自研且未公开的 Harness 测出来的,官方自己也提示这类数字对框架选择高度敏感,建议等社区用其他 Agent 工具(Claude Code、Cursor 等)独立复现后再下结论。

这次更新对普通开发者有什么实际影响?

如果你在用 OpenAI ChatCompletions 或 Anthropic 格式的 API 接入 DeepSeek,不需要改代码,deepseek-v4-flash 这个 model 名会自动指向新的官方版本。如果你此前用的是已经停用的 deepseek-chat/deepseek-reasoner,需要尽快切换到新命名,官方已在 7 月 24 日正式停用旧名称。