1. 看图这件事,现在是原生能力了
以前不少本地模型碰到图片,多少还得拼一个额外的视觉模块。Qwen3.8-27B 从一开始就是原生多模态。
图片、图表、PDF、代码截图都能直接读,视频帧也在它的理解范围里。
更有意思的是电脑操作能力。OSWorld-Verified 测试中,它拿到 84.3 分,高于 Claude Opus 4.6 Max 的 72.7 分。
这种成绩对 Agent 比单纯“看图识字”更有参考价值。真正操作电脑时,模型得先看懂界面,再判断当前状态,最后决定点哪里、输入什么。视觉理解只是第一步,后面的操作链条才更考验模型。
2. 262K 上下文,够用比“够大”更重要
原生 262K Token,已经能装下很长的项目代码、论文、合同和知识库材料。
需要更长时,还能借助 YaRN 拉到 100 万 Token。
对开发者而言,最大的好处是少切文件。以前一个大项目要拆成很多段反复喂,现在可以一次给模型更多完整信息,让它自己梳理依赖和上下文。
但100 万 Token 写在参数表里很漂亮,真跑起来还是得看显存和速度。消费级硬件能不能舒服地把上下文拉满,是另一回事。
所以我更看重 262K 原生这一档——已经足够实用,而且硬件压力相对更现实。
3. 代码才是这次涨得最狠的地方
SWE-bench Pro 从上一代的 53.5 分涨到 61.7 分。
这个幅度值得单独拎出来。
SWE-bench 测的不是“给我写个冒泡排序”这种小题,而是让模型去理解已有项目、定位问题、修改文件,再验证改动有没有把别的地方弄坏。
也就说明,61.7 分背后对应的是更完整的软件工程能力。
拿它做 Coding Agent、自动修 Bug、代码库维护,意义会比单纯的代码生成分数大得多。
当然啦,跑分高不等于可以直接把云端旗舰模型全部换掉。大型仓库、复杂依赖和超长任务里,稳定性还是要自己拿真实项目测。
4. reasoning_effort:别让它每道题都写论文
这一代新增的 reasoning_effort,我反而觉得是最实用的功能之一。
简单问题没必要让模型想半天。摘要、格式转换、普通问答,把推理档位调低,能省时间,也省算力。
碰到复杂代码、逻辑分析或者 Agent 规划,再把思考深度拉高。
这对本地模型尤其重要,因为算力是你自己的。
有海外开发者做过一个很极端的测试:让它画一个“鹈鹕骑自行车”的 SVG。默认高思考强度下,模型跑了大约 2.2 万 Token 的推理,前后花了约 21 分钟。
能力没问题,问题是太认真。
所以 reasoning_effort 最好别一直拉满。简单任务开低档,体验反而更好。
5. 从 Qwen3.6-27B 到 3.8,27B 这个尺寸没白守
Qwen3.8-27B 最有意思的一点,是参数规模没有明显膨胀,但能做的事情更重了。
代码提升最直观。SWE-bench Pro 从 53.5 提升到 61.7,说明软件工程能力往前跨了一步。
办公和专业工作也在涨。JobBench 相关成绩相比上一代提升约 50%,对文档、表格、Office 类任务会更实用。
换句话而言,如果你原本已经有一套能跑 27B 模型的硬件,升级到这一代并不需要重新堆一台机器,却能换来更强的代码、办公和 Agent 能力。
这种升级对本地用户比“参数又大了多少”更有意义。
评论(0)