1. Coding:这次提升最明显
0902 的最大改动,就是代码。
阿里针对 Coding 做了额外后训练,重点不是单次补全,而是复杂工程、多步骤开发和长周期任务。
CodeArena 前端编程榜上,Qwen3.8-Max (0902) 相比原版提升 22 分,达到 1691 分,登上榜首。
一些公开测试里,提升更明显:
- TerminalBench 3.0:11.3 → 29.0
- DeepSWE 1.1:56.6 → 69.3
- NL2Repo-Bench:55.9 → 64.9
- ProgramBench:10.5 → 28.0
- SWE-Marathon:39.1 → 44.8
- QwenSWE-Bench V2:55.1 → 70.0
其中 TerminalBench 和 ProgramBench 的涨幅尤其大,说明它在终端操作、黑箱复现和工程执行这类任务上进步比较明显。
它现在更像一个能接工程任务的 Coding Agent,而不只是写几段代码。
2. Cowork:更适合复杂办公和协作任务
第二个重点是 Cowork。
这里的“协作”不是和人聊天,而是让模型在多个工具、文档和步骤之间持续推进工作。
公开数据里:
- CoWorkBench:74.8 → 76.1
- JobBench:53.4 → 64.0
- WorkArena Elo:1348 → 1468
JobBench 的提升比较明显,说明 0902 在职业任务、办公流程和多步骤执行上有实质进步。
这类任务通常不会一次完成。模型可能先查资料,再调工具,再处理文档,最后整理输出。
0902 的升级价值就在这里:不只是第一步做对,而是整条链路更稳。
3. 视觉理解也跟着补了一轮
0902 不是只改代码。
官方还提到,它在图表推理、文档解析和多模态感知上继续加强。
公开测试中:
- MMMU-Pro:82.3 → 82.7
- ERQA:77.8 → 78.3
- ClawEval-MM:77.2 → 80.2
- BabyVision + CI:91.3 → 93.8
这些提升没有 Coding 那么夸张,但方向比较实用。
如果模型要真正参与办公和 Agent 工作,光会看图片还不够,还得能读图表、解析文档、理解界面,再把这些信息接进后续操作。
0902 在这块更像是补短板。
4. 相比原版 Qwen3.8-Max,进化重点是“执行”
Qwen3.8-Max (0902) 没有改变 100 万 Token 上下文,也没有换一套新架构。
它的升级点主要集中在后训练。
原版已经具备长上下文、Thinking、多模态和工具调用。0902 把这些能力继续往工程和 Agent 场景里推。
最明显的变化不是“回答更聪明了多少”,而是:
- 更能处理大型代码仓库
- 更能在终端里连续操作
- 更能完成端到端开发
- 更能处理长周期任务
- 多工具协同时更稳
这也是为什么 Coding 和 Cowork 会成为 0902 的两个关键词。
评论(0)