首页 / 博客 / Qwen3.8-Max
ENGINEERING_BLOG · 2026.08.04

阿里 Qwen3.8-Max 发布:2.4 万亿参数冲进 Arena 全球前五,下周开源

QWEN3.8-MAX · ARENA 文本
#5

1496 分(Preliminary),前 8 名中唯一非 Anthropic 模型(2026 年 8 月 1 日快照)

如果你在追踪 2026 年 8 月国产万亿参数大模型的发布节奏,阿里巴巴千问 Qwen3.8-Max 是这周绕不开的名字。2026 年 8 月 3 日 GA 全量上线:总参数 2.4 万亿、激活 950 亿、100 万 token 上下文,同步推出 Agent 产品「千问办公」,Arena 文本竞技场冲进全球前五——但截至发稿,所有跑分均来自阿里自测,权重尚未开源。本文梳理从预览版到正式版的两周时间线、核心规格与竞品对比,并拆解「开源」标签挂得比权重早的四个争议点。

SECTION 01 2026 年 8 月万亿参数大战中,Qwen3.8-Max 最该警惕的三个信号

7 月中旬到 8 月初,国产大模型发布密度极高。把 Qwen3.8-Max 放进这条时间线,比单看一张跑分表更能判断风险。

  • 预览版透明度不足:7 月 19 日预览版开放时未公布激活参数量、未提供跑分表,服务条款还明确禁止自动化生产环境调用——多家独立评测机构当时建议「先在自己的业务场景里测试,不要迁移生产系统」。
  • 「开源」标签先于权重落地:GA 当天 qwen.ai 已标注「Open-Source」,但 Hugging Face 与 ModelScope 截至 8 月 4 日仍无对应仓库、许可证条款或确切上线时间,只有「下周」(预计 8 月 10 日前后)的模糊承诺。
  • 跑分权威性与竞品脚注争议:PaperBench、QwenSWEBench、RecreationBench 等多为阿里自建基准;对比表脚注写着「Fable 5 的结果可能涉及 fallback」——对竞品跑分的隐性质疑,而阿里自己的测试方法论同样未公开到可供第三方复现的程度。

时间线速览:

  • 7 月 16 日月之暗面发布 Kimi K3(2.8 万亿参数,7 月 27 日按承诺开源权重)。
  • 7 月 19 日 — Qwen3.8-Max 预览版上线 Token Plan / Qoder / QoderWork,定价为正式价 10%。
  • 7 月 31 日DeepSeek V4-Flash 正式版发布,参数规模不变但智能体/代码基准大幅超过 V4-Pro 预览版。
  • 8 月 3 日 — Qwen3.8-Max GA,发布完整跑分表,「千问办公」同步上线;阿里港股涨约 7%、美股涨约 4.5%。

SECTION 02 Qwen3.8-Max 核心规格与 Arena 排名数据对照

以下数据来自阿里官方发布材料与 Arena.ai 公开排行榜(2026 年 8 月 1 日快照)。带「阿里自测」标注的条目尚无 Artificial Analysis 等第三方平台的正式复现结果。

Qwen3.8-Max 核心数据一览
项目 数值
发布日期 2026 年 8 月 3 日(GA)
总参数 / 激活参数 2.4 万亿 / 950 亿
架构 基于 Qwen3.5 的稀疏 MoE + 混合注意力
上下文窗口 100 万 token(思考模式约 98.3 万,输出上限 13.1 万)
输入模态 文本 / 图像 / 视频
API 定价(国际) 输入 $2/百万 token,输出 $6/百万 token
国内定价(官方口径) 输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元
Arena 文本竞技场 第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型
Arena 视觉竞技场 第 2 名,仅次于 Claude Fable 5
权重开源状态 承诺「下周」,截至 8 月 4 日未上线

在 Arena 文本竞技场前 8 名中,Qwen3.8-Max 是唯一挤进去的非 Anthropic 模型——但排名标注为「初步」,且尚无独立第三方对正式版的完整复现。

SECTION 03 2.4 万亿 MoE 架构拆解:大容量、低激活的设计逻辑

Qwen3.8-Max 延续 Qwen3.5 的稀疏 MoE 路线:总参数 2.4 万亿,实际激活控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这也是 API 定价能压到 $2/$6(明显低于 Claude Opus 5 的 $5/$25 和 Fable 5 的 $10/$50)的架构基础。

  • reasoning_effort 三档:low / medium / xhigh(默认 xhigh),通过 enable_thinking 或 Anthropic 兼容接口的 reasoning.effort 字段调用,按任务复杂度调节速度与深度。
  • 长程自主任务:阿里案例包括 16 天无人工介入的自主编码项目、500+ 步芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原真实应用)——部分过程记录在 GitHub qwen-code-dev-bot/oh-my-cli,但并非完整可复现的第三方审计。
  • 生态卡位:同步接入「千问办公」Agent 平台,API 兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具链。

SECTION 04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4:横向对比矩阵

旗舰模型横向对比(2026 年 8 月初公开数据)
模型 总/激活参数 定价(入/出每百万 token) 权重开源 独立评测
Qwen3.8-Max 2.4T / 950 亿 $2 / $6 未开源(承诺中) 暂无
Kimi K3 2.8T / 约 500 亿 $3 / $15 已开源(7 月 27 日) Artificial Analysis ≈ 57.11 分
DeepSeek V4-Flash 较 V4-Pro 未变 未公开完整表 已开源 9 项智能体/代码基准超 V4-Pro
Claude Fable 5 未公开 $10 / $50 闭源 Arena 文本第 1 名

唯一一次可比的独立盲测(269 个文件的真实项目架构设计任务):Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。Kimi K3 的优势是已开源、有第三方评测;Qwen3.8-Max 的优势是 API 价格更低、多模态更全面。详见GPT-5.6 降价后的 API 价格战格局

SECTION 05 Qwen3.8-Max 发布后的六步评估与接入清单

  1. 确认权重开源时间表:关注阿里官方公告与 Hugging Face / ModelScope 仓库上线,预计 8 月 10 日前后;在权重落地前,「Open-Source」标签仅表示意图而非已交付产物。
  2. 区分总参数与激活参数:2.4 万亿是 MoE 总容量,实际激活 950 亿;API 调用成本按激活量级计费,本地私有化部署完整版则需多节点数据中心级硬件。
  3. 在 Preview 与 GA 基准间做 A/B:预览版无公开跑分,GA 版跑分均为阿里自建框架——建议在自己的业务场景做盲测,勿仅凭厂商表格迁移生产系统。
  4. 核对 API 兼容层:原生 OpenAI 与 Anthropic 双协议支持,迁移 Claude Code / Codex 工作流时重点测试 reasoning.effort 与缓存命中定价(隐式缓存 $0.25、显式写入 $2.5、读取 $0.17)。
  5. 横向比价 Kimi K3 与 DeepSeek V4:若需要已验证的开源权重与独立基准,Kimi K3 更成熟;若追求更低 API 单价与多模态,Qwen3.8-Max 有价格优势。
  6. 关注独立评测机构复测:Artificial Analysis、Arena.ai 正式版收录后,再更新生产选型决策;在此之前将阿里自测数据视为参考而非定论。

SECTION 06 可引用技术数据与权威来源

  • 阿里自测 PaperBench:93.0(较上代提升 28.2 分)
  • 阿里自测 SWE-bench Pro:67.7(落后 Fable 5 的 80.0、Opus 4.8 的 69.2)
  • 阿里自测 HLE:43.6(旗舰模型中最低,Fable 5 为 53.3)
  • 消费端落地:苹果中国市场 Apple Intelligence 的生成式 AI 能力基于经压缩的 Qwen 模型,可在 iPhone 15 及以上本地运行
  • 资本市场反应:发布当日阿里港股涨约 7%、美股涨约 4.5%
  • 行业背景:8 月 4 日白宫召集 OpenAI、Anthropic、Google、Meta 商讨 Agent 网络安全测试框架,与国产大模型加速开源形成对照

以下链接请在发版或上游更新后再次打开核对:

Arena.ai — 文本与视觉竞技场公开排行榜

Alibaba Cloud Model Studio — 官方 API 与定价文档

TechCrunch — Apple Intelligence 中国版与 Qwen 合作报道

纯 API 调用看似便宜,但长程 Agent 7×24 跑下来账单不可控、厂商自测跑分难以复现、权重未开源前无法本地私有化——在需要反复试 prompt、联调工具链、对比 Kimi K3 与 Qwen 路由的生产环境里,成本与稳定性往往比 headline 参数更重要。对于需要零损耗原生算力、在 Mac 上本地跑量化模型做 A/B、同时稳定 iOS CI/CD 与 AI Agent 自动化的团队,VPSNIX 的云端物理节点通常是更优解——100% 苹果原装物理机、完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。结合Mac mini M4 云租赁全解析定价页评估双栈方案。

SECTION 07 常见问题 FAQ

Qwen3.8-Max 现在能直接用吗?开源了没有?

API 已可通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,Hugging Face / ModelScope 仓库、开源协议条款要等到官方口径的「下周」(预计 8 月 10 日前后)才会公布,具体日期以官方公告为准。

Qwen3.8-Max 和 Kimi K3 到底谁更强?

目前没有权威的、双方都认可的统一评测。唯一一次可比的独立盲测显示两者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 预览版 80 分),属于同档位、互有胜负。Kimi K3 的优势是已开源、有第三方评测;Qwen3.8-Max 的优势是 API 价格更低、多模态更全面。

2.4 万亿参数是不是意味着普通开发者根本用不起?

需要区分总参数和激活参数。实际激活 950 亿,通过 API 调用成本接近千亿级模型。本地私有化部署完整版需要多节点数据中心级硬件;更现实的选择是等待同期开源的精简版 Qwen3.8-27B。

阿里公布的跑分能信吗?

可以作为参考,但不能当作定论。所有数据目前均来自阿里自建测试框架,Arena 排名也标注为「初步」。建议关注后续独立评测机构的复测,或在自己的实际业务场景里做 A/B 测试。

这次发布对普通用户有什么实际影响?

除了开发者能拿到更便宜的旗舰级 API 之外,苹果在中国市场的 Apple Intelligence 功能基于 Qwen 模型(经压缩后本地运行),国内 iPhone 用户未来会在系统层面直接用到千问系列模型的能力。