Qwen3.8 2.4T A95B

一个能把复杂任务连续做很多天的开源大模型
4.75
比起单纯回答问题,它更大的看点是能不能把一件复杂的事持续做下去。
Advertisement 728 × 90
公司Alibaba
上下文262K
发布日期2026-08
更新日期2026-08-13

Qwen3.8 2.4T A95B 用一张图告诉你!

Qwen3.8 2.4T A95B

Qwen3.8 2.4T A95B 概述

阿里公布过一个很受关注的软件工程测试。

Qwen3.8-Max 连续运行了 16 天,从零开始开发一个可以自我改进的 Agent 框架。

这16天里,它不是简单地不停生成代码,而是在反复做一套完整流程:

写代码、运行测试、看结果、发现问题,再继续修改。

这件事其实比单次写出一段好代码难得多。

现在会写代码的大模型很多,但任务一旦拖得很长,模型就容易开始跑偏。

前面定好的目标可能忘了,修了一个 Bug 又带出新的 Bug,文件越来越多以后,整个项目也越来越难管理。

所以“16天”真正值得关注的,不是这个数字有多夸张,而是模型在这么长的任务里还能不能继续往前做。

当然,这仍然是阿里官方公布的一次测试,不能直接理解成任何软件项目交给它以后,都可以16天完全不用人管。

真实项目里还会碰到开发环境、权限、依赖、第三方 API、部署和团队协作等问题。

除了编程,Qwen3.8-Max 还强化了长上下文、多模态和工具调用能力。

云端版最高支持 100 万 Token 上下文,可以一次处理非常多的资料。

开放权重版 Qwen3.8-2.4T-A95B 原生支持大约 26万 Token,也可以进一步扩展到约100万 Token。

不过两个版本不能完全混着看。

Qwen3.8-Max 云端版可以处理文本、图片和视频;开放权重的 Qwen3.8-2.4T-A95B 目前主要是纯文本模型。

开放版还有一个特点:默认必须使用思考模式,更适合复杂任务,但拿来做特别简单的问答就显得有点重。

Qwen3.8 2.4T A95B 定价

套餐价格说明
API 按量计费 输入 12元/百万 Token;输出 36元/百万 Token 用多少付多少。适合开发网站、App、后端服务以及调用量不固定的用户。缓存命中和 Batch 调用价格更低。
Token Plan 个人版 Lite:39元/月;Standard:139元/月;Pro:499元/月(当前限时价) 面向个人开发者,以 Credits 扣费,主要用于 AI 编程和 Agent 工具。不同档位对应不同的周期额度。
Token Plan 团队版 Standard:150元/座席/月;Pro:550元/座席/月;Max:1398元/座席/月 面向企业和多人团队,提供更高 Credits 额度,同时支持成员管理和团队用量统计。

Qwen3.8 2.4T A95B 主要功能

  1. 自主编程和长周期任务
    能从需求理解开始,自己拆任务、修改代码、运行测试、检查结果,再继续往下做。阿里公布的测试中,Qwen3.8-Max 曾连续运行16天开发一个自我改进的 Agent 框架。
  2. 长文档和大量资料处理
    云端版最高支持100万 Token 上下文,可以一次处理大量文档、代码、合同、研究报告和企业内部资料,适合需要“先看很多材料,再做判断”的任务。
  3. 图片和视频理解
    Qwen3.8-Max 云端版支持图片和视频输入,可以分析 UI 截图、文档图片和长视频内容,也能用于根据截图还原网页等任务。需要注意,开放权重版目前主要是纯文本模型。
  4. Agent 和工具调用
    不只是告诉用户“应该怎么做”,还可以调用工具、读取文件、运行代码、处理数据,并根据执行结果继续下一步,更适合自动化工作流。
  5. 复杂工程优化
    除了软件开发,阿里还用它测试过芯片设计优化。模型可以反复修改方案、运行仿真、查看结果,再继续调整,适合需要多轮试错和持续优化的工程任务。

Qwen3.8 2.4T A95B 与上一代对比

如果拿 Qwen3.8 和上一代 Qwen3.7-Max 比,我不太建议用“上一代只是高级助理,这一代直接变成资深工程师”这种说法。

听起来很有传播力,但有点夸张。

Qwen3.7-Max 本身已经可以推理、写代码、调用工具和处理长上下文,并不是一个只会简单聊天的模型。

Qwen3.8 更明显的变化,是把重点进一步放到了:

  • 长时间任务
  • Agent
  • 软件工程
  • 工具调用
  • 多模态
  • 根据结果不断修改

简单说,Qwen3.7 已经能帮你做很多事情,而 Qwen3.8 更强调“做完这一步以后,自己还能接着往下做”。

这个区别在简单问答里未必特别明显。

但任务一旦变成几十步、几百步,甚至需要持续几天,差距就更容易体现出来。

所以这一代最大的变化,我觉得不是“突然聪明了一倍”,而是执行能力明显变强了

优缺点

优点

长任务能力很突出

这是 Qwen3.8 最大的卖点。

现在会写代码的大模型很多,但能不能在一个项目上持续工作很长时间,而且还能根据结果不断调整,是另一回事。

16天软件工程测试至少说明,这一代模型已经开始认真解决这个问题。

编程能力不再局限于代码片段

它更强调完整软件项目,包括理解需求、修改文件、运行代码、测试和继续修正。

对于 AI 编程和 Agent 产品来说,这比单纯代码补全更有价值。

能处理大量资料

云端版最高100万 Token 的上下文,很适合长文档、大型代码库和企业资料分析。

对于真实办公环境,这类能力比单纯聊天更实用。

开放权重

Qwen3.8-2.4T-A95B 的模型权重开放以后,研究机构和有足够算力的公司可以自己部署、研究和二次开发。

对于这个规模的旗舰模型来说,开放权重本身就很有吸引力。

API价格比较有竞争力

Qwen3.8-Max 已经可以直接通过阿里云百炼调用。

不需要自己准备巨量 GPU,就能直接使用旗舰模型能力。

缺点

本地部署门槛非常高

2.4万亿参数不是普通电脑能处理的规模。

即使开放了权重,也需要大量存储、内存、显存以及多卡推理环境。

所以:

开源,不等于普通人能本地跑。

对个人开发者来说,API 通常更实际。

开放版对简单任务有点重

开放权重版目前需要使用思考模式。

如果是复杂编程、研究和 Agent 任务,这没什么问题。

但如果只是FAQ、分类、简单摘要,使用这么大的模型就有点浪费。

长任务仍然需要人工审核

16天自主编程案例很亮眼,但不能把厂商测试直接当成生产环境承诺。

现实项目仍然需要代码审核、测试、权限管理和人工验收。

目前把它直接称为“完全不需要管理的数字员工”,还是有点早。

云端版和开放版能力并不完全一致

云端 Max 能处理图片和视频,而目前的开放权重版主要是文本。

使用前需要先搞清楚自己到底需要哪个版本。

适合谁 / 不适合谁

适合谁

做 Agent 的团队

如果产品需要 AI 自己调用工具、读文件、写代码、检查结果,然后继续完成下一步,Qwen3.8 很值得测试。

AI 编程团队

尤其是希望模型能够处理完整项目,而不只是生成代码片段的团队。

需要处理大量资料的企业

比如公司知识库、研究报告、合同、财务材料或者大型代码仓库。

大型企业和研究机构

如果希望自己控制模型权重,做内部部署、研究或者二次开发,开放版会比较有价值。

直接通过 API 做产品的开发者

对于大多数开发者来说,这是使用 Qwen3.8 最现实的方法。

不用自己解决2.4万亿参数模型的部署问题。

不适合谁

只做简单问答的应用

FAQ、简单分类、基础摘要没必要使用这么大的模型。

更小的模型往往更便宜、更快。

想在普通电脑上运行的人

开放版不是给一张消费级显卡准备的。

本地部署需要非常强的硬件资源。

特别追求低延迟的应用

复杂推理和长任务会增加响应时间。

对速度要求非常高的业务,小模型可能更合适。

完全不准备人工审核的企业

Qwen3.8 的自主能力确实很强,但现阶段仍然不能完全跳过人工验收。

尤其是代码、法律、金融等高风险场景。

评论(0)

发表评论

Advertisement 728 × 90

Alibaba 模型对比

模型 上下文 定价 API 发布 全球热度
Qwen3.8 2.4T A95B
262K $2.000 / $6.000 per 1M YES 2026-08
90/100
1M $2.000 / $6.000 per 1M YES 2026-08
88/100
1M $0.030 / $0.130 per 1M YES 2026-07
79/100
1M 付费 YES 2026-06
81/100
1M $1.475 / $4.425 per 1M YES 2026-05
87/100

类似模型

关联工具