Qwen3.8 Max (0902)

9 月 2 日,阿里把 Qwen3.8-Max 更新到了 0902 版本。 这次不是重新做了一颗新模型,而是在原版 Qwen3.8-Max 上继续后训练,重点补强 Coding 和 Cowork。阿里官方对它的描述也很直接:更适合复杂软件工程、长周期开发、多工具协作和端到端任务交付。
Advertisement 728 × 90
公司Alibaba
上下文1M
发布日期2026-09
更新日期2026-09-08

Qwen3.8 Max (0902) 概述

Qwen3.8-Max (0902) 的正式模型 ID 是 qwen3.8-max-0902,也可以写作 qwen3.8-max-2026-09-02。

它是 Qwen3.8-Max 的升级快照,不是重新训练出来的新一代模型。原本的核心规格基本保留,包括:

100 万 Token 上下文
Thinking / Non-Thinking 两种模式
文本、图像、视频输入
Function Calling
Structured Outputs
Web Search
Context Caching

官方把这次升级的重点放在三块:工程级编程、协作型 Agent、视觉理解。

如果把原版 Qwen3.8-Max 看成一个已经能处理复杂任务的旗舰模型,0902 更像是在它基础上继续打磨“干活能力”。

Qwen3.8 Max (0902) 定价

套餐价格说明
API 输入 $1.65 / 百万 Token 按输入量计费
API 输出 $4.951 / 百万 Token 按生成量计费
Context Cache 有缓存折扣 长上下文重复调用时可降低成本

Qwen3.8 Max (0902) 主要功能

1. Coding:这次提升最明显

0902 的最大改动,就是代码。

阿里针对 Coding 做了额外后训练,重点不是单次补全,而是复杂工程、多步骤开发和长周期任务。

CodeArena 前端编程榜上,Qwen3.8-Max (0902) 相比原版提升 22 分,达到 1691 分,登上榜首。

一些公开测试里,提升更明显:

  • TerminalBench 3.0:11.3 → 29.0
  • DeepSWE 1.1:56.6 → 69.3
  • NL2Repo-Bench:55.9 → 64.9
  • ProgramBench:10.5 → 28.0
  • SWE-Marathon:39.1 → 44.8
  • QwenSWE-Bench V2:55.1 → 70.0

其中 TerminalBench 和 ProgramBench 的涨幅尤其大,说明它在终端操作、黑箱复现和工程执行这类任务上进步比较明显。

它现在更像一个能接工程任务的 Coding Agent,而不只是写几段代码。

2. Cowork:更适合复杂办公和协作任务

第二个重点是 Cowork

这里的“协作”不是和人聊天,而是让模型在多个工具、文档和步骤之间持续推进工作。

公开数据里:

  • CoWorkBench:74.8 → 76.1
  • JobBench:53.4 → 64.0
  • WorkArena Elo:1348 → 1468

JobBench 的提升比较明显,说明 0902 在职业任务、办公流程和多步骤执行上有实质进步。

这类任务通常不会一次完成。模型可能先查资料,再调工具,再处理文档,最后整理输出。

0902 的升级价值就在这里:不只是第一步做对,而是整条链路更稳。

3. 视觉理解也跟着补了一轮

0902 不是只改代码。

官方还提到,它在图表推理、文档解析和多模态感知上继续加强。

公开测试中:

  • MMMU-Pro:82.3 → 82.7
  • ERQA:77.8 → 78.3
  • ClawEval-MM:77.2 → 80.2
  • BabyVision + CI:91.3 → 93.8

这些提升没有 Coding 那么夸张,但方向比较实用。

如果模型要真正参与办公和 Agent 工作,光会看图片还不够,还得能读图表、解析文档、理解界面,再把这些信息接进后续操作。

0902 在这块更像是补短板。

4. 相比原版 Qwen3.8-Max,进化重点是“执行”

Qwen3.8-Max (0902) 没有改变 100 万 Token 上下文,也没有换一套新架构。

它的升级点主要集中在后训练。

原版已经具备长上下文、Thinking、多模态和工具调用。0902 把这些能力继续往工程和 Agent 场景里推。

最明显的变化不是“回答更聪明了多少”,而是:

  • 更能处理大型代码仓库
  • 更能在终端里连续操作
  • 更能完成端到端开发
  • 更能处理长周期任务
  • 多工具协同时更稳

这也是为什么 Coding 和 Cowork 会成为 0902 的两个关键词。

总结

优势

  • Coding 提升明显:多项 Agent 编程和工程测试涨幅很大。
  • 长周期任务更强:更适合复杂开发、终端操作和持续执行。
  • Cowork 能力更成熟:多工具、多步骤办公任务表现更好。
  • 100 万 Token 上下文保留:适合大型代码库、长文档和复杂项目。
  • API 定价没有因为 0902 升级而上涨:官方 Model Studio 中与原版保持同档。

限制

  • 不是完整换代:0902 本质上还是 Qwen3.8-Max 的后训练升级版。
  • 并非所有能力都大幅提升:视觉类 benchmark 的增幅明显小于 Coding。
  • 长任务依然可能很耗 Token:尤其是 Thinking + 100 万 Token 上下文场景。
  • 独立测试还需要更多时间:0902 发布不久,现阶段不少数据仍来自官方或基于官方测试整理。

推荐人群

  • 做大型代码项目和 Agent 编程的开发者
  • 需要 AI 操作工具、终端和多步骤工作流的团队
  • 经常处理大型代码库、长文档的企业用户
  • 想用国产模型做复杂 Agent 和办公自动化的人

不推荐人群

  • 主要拿 AI 聊天、写短文案的轻度用户
  • 任务很简单,不需要 100 万 Token 上下文的人
  • 极度看重低延迟和最低调用成本的场景
  • 只看参数规模、不做复杂任务的用户

评论(0)

发表评论

Advertisement 728 × 90

Alibaba 模型对比

模型 上下文 定价 API 发布 全球热度
Qwen3.8 Max (0902)
1M $2.000 / $6.000 per 1M YES 2026-09
1M $2.000 / $6.000 per 1M YES 2026-08
87/100
262K $2.000 / $6.000 per 1M YES 2026-08
90/100
262K $0.450 / $3.200 per 1M YES 2026-08
60/100
1M $0.150 / $0.470 per 1M YES 2026-08
83/100

类似模型

Qwen3-235B
99
阿里巴巴 MoE 模型,以 220 亿激活参数实现高质量低成本推理。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
96
图文输入+文本输出,视觉语言全面升级,同时保留编码和工具调用的完整智能体能力。
Alibaba
Qwen3.8 2.4T A95B
95
比起单纯回答问题,它更大的看点是能不能把一件复杂的事持续做下去。就我自己写代码的体验来说,卡住的时候最需要的不是有人重新讲一遍基础概念,而是能沿着我目前的思路继续往下推。
Alibaba
Qwen3.7 Flash
92
阿里云通义千问推出的新一代 Flash 模型,支持多模态理解、AI Agent、代码开发和高效推理。
Alibaba

关联工具