如果你在追踪 2026 年 8 月国产万亿参数大模型的发布节奏,阿里巴巴千问 Qwen3.8-Max 是这周绕不开的名字。2026 年 8 月 3 日 GA 全量上线:总参数 2.4 万亿、激活 950 亿、100 万 token 上下文,同步推出 Agent 产品「千问办公」,Arena 文本竞技场冲进全球前五——但截至发稿,所有跑分均来自阿里自测,权重尚未开源。本文梳理从预览版到正式版的两周时间线、核心规格与竞品对比,并拆解「开源」标签挂得比权重早的四个争议点。
SECTION 01 2026 年 8 月万亿参数大战中,Qwen3.8-Max 最该警惕的三个信号
7 月中旬到 8 月初,国产大模型发布密度极高。把 Qwen3.8-Max 放进这条时间线,比单看一张跑分表更能判断风险。
- 预览版透明度不足:7 月 19 日预览版开放时未公布激活参数量、未提供跑分表,服务条款还明确禁止自动化生产环境调用——多家独立评测机构当时建议「先在自己的业务场景里测试,不要迁移生产系统」。
- 「开源」标签先于权重落地:GA 当天 qwen.ai 已标注「Open-Source」,但 Hugging Face 与 ModelScope 截至 8 月 4 日仍无对应仓库、许可证条款或确切上线时间,只有「下周」(预计 8 月 10 日前后)的模糊承诺。
- 跑分权威性与竞品脚注争议:PaperBench、QwenSWEBench、RecreationBench 等多为阿里自建基准;对比表脚注写着「Fable 5 的结果可能涉及 fallback」——对竞品跑分的隐性质疑,而阿里自己的测试方法论同样未公开到可供第三方复现的程度。
时间线速览:
- 7 月 16 日 — 月之暗面发布 Kimi K3(2.8 万亿参数,7 月 27 日按承诺开源权重)。
- 7 月 19 日 — Qwen3.8-Max 预览版上线 Token Plan / Qoder / QoderWork,定价为正式价 10%。
- 7 月 31 日 — DeepSeek V4-Flash 正式版发布,参数规模不变但智能体/代码基准大幅超过 V4-Pro 预览版。
- 8 月 3 日 — Qwen3.8-Max GA,发布完整跑分表,「千问办公」同步上线;阿里港股涨约 7%、美股涨约 4.5%。
SECTION 02 Qwen3.8-Max 核心规格与 Arena 排名数据对照
以下数据来自阿里官方发布材料与 Arena.ai 公开排行榜(2026 年 8 月 1 日快照)。带「阿里自测」标注的条目尚无 Artificial Analysis 等第三方平台的正式复现结果。
| 项目 | 数值 |
|---|---|
| 发布日期 | 2026 年 8 月 3 日(GA) |
| 总参数 / 激活参数 | 2.4 万亿 / 950 亿 |
| 架构 | 基于 Qwen3.5 的稀疏 MoE + 混合注意力 |
| 上下文窗口 | 100 万 token(思考模式约 98.3 万,输出上限 13.1 万) |
| 输入模态 | 文本 / 图像 / 视频 |
| API 定价(国际) | 输入 $2/百万 token,输出 $6/百万 token |
| 国内定价(官方口径) | 输入 12 元/百万 token,输出 36 元/百万 token,缓存命中低至 1.5 元 |
| Arena 文本竞技场 | 第 5 名,1496 分(Preliminary);前 8 名中唯一非 Anthropic 模型 |
| Arena 视觉竞技场 | 第 2 名,仅次于 Claude Fable 5 |
| 权重开源状态 | 承诺「下周」,截至 8 月 4 日未上线 |
在 Arena 文本竞技场前 8 名中,Qwen3.8-Max 是唯一挤进去的非 Anthropic 模型——但排名标注为「初步」,且尚无独立第三方对正式版的完整复现。
SECTION 03 2.4 万亿 MoE 架构拆解:大容量、低激活的设计逻辑
Qwen3.8-Max 延续 Qwen3.5 的稀疏 MoE 路线:总参数 2.4 万亿,实际激活控制在 950 亿——推理成本更接近千亿级模型,而非真正调用 2.4 万亿参数。这也是 API 定价能压到 $2/$6(明显低于 Claude Opus 5 的 $5/$25 和 Fable 5 的 $10/$50)的架构基础。
- reasoning_effort 三档:low / medium / xhigh(默认 xhigh),通过
enable_thinking或 Anthropic 兼容接口的reasoning.effort字段调用,按任务复杂度调节速度与深度。 - 长程自主任务:阿里案例包括 16 天无人工介入的自主编码项目、500+ 步芯片设计优化,以及自建 RecreationBench(黑盒环境下仅凭交互与视觉反馈还原真实应用)——部分过程记录在 GitHub
qwen-code-dev-bot/oh-my-cli,但并非完整可复现的第三方审计。 - 生态卡位:同步接入「千问办公」Agent 平台,API 兼容 OpenAI 与 Anthropic 两种协议,可直接接入 Claude Code、Codex、Qoder CLI、Qwen Code、OpenClaw 等工具链。
SECTION 04 Qwen3.8-Max vs Kimi K3 vs DeepSeek V4:横向对比矩阵
| 模型 | 总/激活参数 | 定价(入/出每百万 token) | 权重开源 | 独立评测 |
|---|---|---|---|---|
| Qwen3.8-Max | 2.4T / 950 亿 | $2 / $6 | 未开源(承诺中) | 暂无 |
| Kimi K3 | 2.8T / 约 500 亿 | $3 / $15 | 已开源(7 月 27 日) | Artificial Analysis ≈ 57.11 分 |
| DeepSeek V4-Flash | 较 V4-Pro 未变 | 未公开完整表 | 已开源 | 9 项智能体/代码基准超 V4-Pro |
| Claude Fable 5 | 未公开 | $10 / $50 | 闭源 | Arena 文本第 1 名 |
唯一一次可比的独立盲测(269 个文件的真实项目架构设计任务):Kimi K3 得 83 分,Qwen3.8-Max 预览版得 80 分——差距很小,属于「互有胜负」而非「全面碾压」。Kimi K3 的优势是已开源、有第三方评测;Qwen3.8-Max 的优势是 API 价格更低、多模态更全面。详见GPT-5.6 降价后的 API 价格战格局。
SECTION 05 Qwen3.8-Max 发布后的六步评估与接入清单
- 确认权重开源时间表:关注阿里官方公告与 Hugging Face / ModelScope 仓库上线,预计 8 月 10 日前后;在权重落地前,「Open-Source」标签仅表示意图而非已交付产物。
- 区分总参数与激活参数:2.4 万亿是 MoE 总容量,实际激活 950 亿;API 调用成本按激活量级计费,本地私有化部署完整版则需多节点数据中心级硬件。
- 在 Preview 与 GA 基准间做 A/B:预览版无公开跑分,GA 版跑分均为阿里自建框架——建议在自己的业务场景做盲测,勿仅凭厂商表格迁移生产系统。
- 核对 API 兼容层:原生 OpenAI 与 Anthropic 双协议支持,迁移 Claude Code / Codex 工作流时重点测试
reasoning.effort与缓存命中定价(隐式缓存 $0.25、显式写入 $2.5、读取 $0.17)。 - 横向比价 Kimi K3 与 DeepSeek V4:若需要已验证的开源权重与独立基准,Kimi K3 更成熟;若追求更低 API 单价与多模态,Qwen3.8-Max 有价格优势。
- 关注独立评测机构复测:Artificial Analysis、Arena.ai 正式版收录后,再更新生产选型决策;在此之前将阿里自测数据视为参考而非定论。
SECTION 06 可引用技术数据与权威来源
- 阿里自测 PaperBench:93.0(较上代提升 28.2 分)
- 阿里自测 SWE-bench Pro:67.7(落后 Fable 5 的 80.0、Opus 4.8 的 69.2)
- 阿里自测 HLE:43.6(旗舰模型中最低,Fable 5 为 53.3)
- 消费端落地:苹果中国市场 Apple Intelligence 的生成式 AI 能力基于经压缩的 Qwen 模型,可在 iPhone 15 及以上本地运行
- 资本市场反应:发布当日阿里港股涨约 7%、美股涨约 4.5%
- 行业背景:8 月 4 日白宫召集 OpenAI、Anthropic、Google、Meta 商讨 Agent 网络安全测试框架,与国产大模型加速开源形成对照
以下链接请在发版或上游更新后再次打开核对:
Alibaba Cloud Model Studio — 官方 API 与定价文档
TechCrunch — Apple Intelligence 中国版与 Qwen 合作报道
纯 API 调用看似便宜,但长程 Agent 7×24 跑下来账单不可控、厂商自测跑分难以复现、权重未开源前无法本地私有化——在需要反复试 prompt、联调工具链、对比 Kimi K3 与 Qwen 路由的生产环境里,成本与稳定性往往比 headline 参数更重要。对于需要零损耗原生算力、在 Mac 上本地跑量化模型做 A/B、同时稳定 iOS CI/CD 与 AI Agent 自动化的团队,VPSNIX 的云端物理节点通常是更优解——100% 苹果原装物理机、完整 Root 权限、无 Hypervisor 损耗、按天/周/月弹性下单。结合Mac mini M4 云租赁全解析与定价页评估双栈方案。
SECTION 07 常见问题 FAQ
Qwen3.8-Max 现在能直接用吗?开源了没有?
API 已可通过 QwenCloud 调用,兼容 OpenAI 和 Anthropic 两种接口协议。但权重尚未开源,Hugging Face / ModelScope 仓库、开源协议条款要等到官方口径的「下周」(预计 8 月 10 日前后)才会公布,具体日期以官方公告为准。
Qwen3.8-Max 和 Kimi K3 到底谁更强?
目前没有权威的、双方都认可的统一评测。唯一一次可比的独立盲测显示两者打分非常接近(Kimi K3 83 分、Qwen3.8-Max 预览版 80 分),属于同档位、互有胜负。Kimi K3 的优势是已开源、有第三方评测;Qwen3.8-Max 的优势是 API 价格更低、多模态更全面。
2.4 万亿参数是不是意味着普通开发者根本用不起?
需要区分总参数和激活参数。实际激活 950 亿,通过 API 调用成本接近千亿级模型。本地私有化部署完整版需要多节点数据中心级硬件;更现实的选择是等待同期开源的精简版 Qwen3.8-27B。
阿里公布的跑分能信吗?
可以作为参考,但不能当作定论。所有数据目前均来自阿里自建测试框架,Arena 排名也标注为「初步」。建议关注后续独立评测机构的复测,或在自己的实际业务场景里做 A/B 测试。
这次发布对普通用户有什么实际影响?
除了开发者能拿到更便宜的旗舰级 API 之外,苹果在中国市场的 Apple Intelligence 功能基于 Qwen 模型(经压缩后本地运行),国内 iPhone 用户未来会在系统层面直接用到千问系列模型的能力。