Qwen3.8 27B

3.90
阿里千问团队终于把开源社区等了很久的 Qwen3.8-27B 放了出来。真正让我感兴趣的是它的尺寸:27B。这个体量还没大到只能躺在服务器机房里,量化之后,高端消费级显卡也有机会跑起来;但从代码、Agent 和多模态成绩来看,它已经摸到了顶级闭源模型的门槛。
Advertisement 728 × 90
公司Alibaba
上下文262K
发布日期2026-08
更新日期2026-08-17

Qwen3.8 27B 概述

Qwen3.8-27B 是阿里开源的 270 亿参数原生多模态 Dense 模型。
27B 不算小,但放在今天的大模型里也谈不上夸张。这个尺寸比较讨巧:服务器部署没问题,量化之后,一张高端消费级显卡也有机会装得下。
能力给得倒很完整。文字、图片、代码、图表、PDF 都能直接处理,原生上下文达到 262K Token,通过 YaRN 还能扩展到 100 万 Token。
协议也是一个加分项:Apache 2.0。
个人下载、研究、二次开发都没问题,企业拿去做商业部署也比较省心。对代码、合同、内部知识库这类不适合上传第三方云端的数据,本地跑的价值尤其明显。

Qwen3.8 27B 定价

套餐价格说明
开源自部署 免费 Apache 2.0 全量权重,可部署在本地。24GB 显存级别的高端消费卡可尝试量化版本,适合开发者、极客和数据敏感型企业。
官方 API 输入 12 元 / 百万 Token;输出 36 元 / 百万 Token 不需要准备硬件,即开即用。更适合偶尔调用、轻量应用,或者不想维护本地推理环境的用户。
API 缓存命中 1.5 元 / 百万 Token 适合反复读取长文档、固定知识库等场景,可以明显压低重复上下文的成本。

手里已经有 RTX 4090、3090,或者高内存 Apple Silicon 设备,本地部署会更有吸引力:没有 Token 账单,数据也留在自己机器里。如果只是偶尔用,API 反而更省事。量化、显存分配、推理框架这些折腾成本,也得算进去。

Qwen3.8 27B 主要功能

1. 看图这件事,现在是原生能力了

以前不少本地模型碰到图片,多少还得拼一个额外的视觉模块。Qwen3.8-27B 从一开始就是原生多模态。

图片、图表、PDF、代码截图都能直接读,视频帧也在它的理解范围里。

更有意思的是电脑操作能力。OSWorld-Verified 测试中,它拿到 84.3 分,高于 Claude Opus 4.6 Max 的 72.7 分。

这种成绩对 Agent 比单纯“看图识字”更有参考价值。真正操作电脑时,模型得先看懂界面,再判断当前状态,最后决定点哪里、输入什么。视觉理解只是第一步,后面的操作链条才更考验模型。

2. 262K 上下文,够用比“够大”更重要

原生 262K Token,已经能装下很长的项目代码、论文、合同和知识库材料。

需要更长时,还能借助 YaRN 拉到 100 万 Token

对开发者而言,最大的好处是少切文件。以前一个大项目要拆成很多段反复喂,现在可以一次给模型更多完整信息,让它自己梳理依赖和上下文。

但100 万 Token 写在参数表里很漂亮,真跑起来还是得看显存和速度。消费级硬件能不能舒服地把上下文拉满,是另一回事。

所以我更看重 262K 原生这一档——已经足够实用,而且硬件压力相对更现实。

3. 代码才是这次涨得最狠的地方

SWE-bench Pro 从上一代的 53.5 分涨到 61.7 分

这个幅度值得单独拎出来。

SWE-bench 测的不是“给我写个冒泡排序”这种小题,而是让模型去理解已有项目、定位问题、修改文件,再验证改动有没有把别的地方弄坏。

也就说明,61.7 分背后对应的是更完整的软件工程能力。

拿它做 Coding Agent、自动修 Bug、代码库维护,意义会比单纯的代码生成分数大得多。

当然啦,跑分高不等于可以直接把云端旗舰模型全部换掉。大型仓库、复杂依赖和超长任务里,稳定性还是要自己拿真实项目测。

4. reasoning_effort:别让它每道题都写论文

这一代新增的 reasoning_effort,我反而觉得是最实用的功能之一。

简单问题没必要让模型想半天。摘要、格式转换、普通问答,把推理档位调低,能省时间,也省算力。

碰到复杂代码、逻辑分析或者 Agent 规划,再把思考深度拉高。

这对本地模型尤其重要,因为算力是你自己的。

有海外开发者做过一个很极端的测试:让它画一个“鹈鹕骑自行车”的 SVG。默认高思考强度下,模型跑了大约 2.2 万 Token 的推理,前后花了约 21 分钟。

能力没问题,问题是太认真。

所以 reasoning_effort 最好别一直拉满。简单任务开低档,体验反而更好。

5. 从 Qwen3.6-27B 到 3.8,27B 这个尺寸没白守

Qwen3.8-27B 最有意思的一点,是参数规模没有明显膨胀,但能做的事情更重了。

代码提升最直观。SWE-bench Pro 从 53.5 提升到 61.7,说明软件工程能力往前跨了一步。

办公和专业工作也在涨。JobBench 相关成绩相比上一代提升约 50%,对文档、表格、Office 类任务会更实用。

换句话而言,如果你原本已经有一套能跑 27B 模型的硬件,升级到这一代并不需要重新堆一台机器,却能换来更强的代码、办公和 Agent 能力。

这种升级对本地用户比“参数又大了多少”更有意义。

总结

优势

27B 这个尺寸,是 Qwen3.8-27B 最大的魅力。

它还处在个人开发者和中小团队能自己部署的范围里,却把多模态、长上下文、代码、Agent 和可调推理深度都塞了进来。

Apache 2.0 也让它特别适合私有部署、微调和商业项目。对于不想把内部数据发到云端的团队,这一点甚至比 benchmark 更重要。

限制

本地能跑,不等于本地跑得快。

高 reasoning_effort 开着不管,很容易让简单任务也变成一场长跑;上下文拉到几十万甚至接近百万 Token 时,对显存和推理速度的压力也会迅速上升。

所以真正部署时,量化方式、上下文长度和 reasoning_effort 都得自己调。默认配置未必就是最好用的配置。

推荐人群

手里已经有 4090、3090 这类大显存显卡,或者本来就在做本地模型、Coding Agent、企业私有化部署的人,基本都值得试。

需要全量权重做微调的研究人员,也很适合这一版。

不推荐人群

需求只是聊天、写文案、偶尔总结几个文件,直接用在线服务会轻松得多。

没有合适硬件,又不想付 API 费用的人,也很难真正发挥它的价值。专门为了跑 Qwen3.8-27B 去买一张高端显卡,账未必算得过来。

评论(0)

发表评论

Advertisement 728 × 90

Alibaba 模型对比

模型 上下文 定价 API 发布 全球热度
Qwen3.8 27B
262K $0.450 / $3.200 per 1M YES 2026-08
60/100
1M $2.000 / $6.000 per 1M YES 2026-08
88/100
262K $2.000 / $6.000 per 1M YES 2026-08
90/100
1M $0.030 / $0.130 per 1M YES 2026-07
79/100
1M 付费 YES 2026-06
81/100

类似模型

关联工具