Qwen3.8 Flash

2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Advertisement 728 × 90
公司Alibaba
上下文1M
发布日期2026-08
更新日期2026-09-01

Qwen3.8 Flash 概述

Qwen3.8-Flash 采用混合专家(MoE)架构,支持文本、图像和视频输入,输出为文本。

模型原生支持 26 万 tokens 上下文窗口,通过 YaRN 可以扩展到百万级,适合长文档、代码库、多轮对话和长流程 Agent 任务。

架构上,它使用混合注意力机制、门控残差等设计,重点是减少长序列处理时的计算开销。

官方测试中,Qwen3.8-Flash 在编程辅助、Agent 和长程任务上的表现较强,包括 SWE-bench Pro、JobBench 等项目,部分成绩超过 Claude Opus 4.6。

模型已经接入阿里云百炼,API 可以直接调用。

Qwen3.8 Flash 定价

套餐价格说明
按量付费(输入) 0.8 元 / 百万 tokens 普通 API 调用
按量付费(输出) 2.7 元 / 百万 tokens 按实际生成内容计费
缓存命中(输入) 0.1 元 / 百万 tokens 长对话、固定提示词、重复上下文
Coding Plan Credits 共享额度 高频写代码、调试

百炼还提供夜间订阅,主要面向批量离线任务,价格更低。

新用户也有一定免费额度,例如 100 万 tokens,可以先用来做功能验证。

如果只是高频写代码、反复调试,Coding Plan 会更省心;如果是长文档、多轮对话或 Agent 这类重复上下文较多的业务,按量计费配合缓存通常更划算。

Qwen3.8 Flash 主要功能

1. 长上下文处理

Qwen3.8-Flash 原生支持 26 万 tokens,上下文还能通过 YaRN 扩展到百万级。

大型代码库、几百页材料、多轮会议记录这类内容,可以一次放进去更多,减少频繁切分带来的信息损失。

这对代码分析和 Agent 尤其有用。模型如果只能看到局部文件,很难理解完整调用关系;任务跑得越久,历史状态越多,对上下文容量的要求也越高。

但长上下文只是基础能力,能放进去不代表所有内容都能同样稳定地处理好。

2. 多模态理解

Qwen3.8-Flash 支持文本、图片和视频输入。

图表分析、图片内容识别、视频片段理解,都可以放到同一个模型里完成。

这一点放到真实工作流里比较实用。实际输入往往不是纯文字,可能同时包含 PDF、截图、图片和视频,多模态能力可以减少中间转换步骤。

3. Agent 与编程能力

Qwen3.8-Flash 对 Agent 和编程场景的倾向比较明显。

官方公布的测试中,它在 SWE-bench Pro、JobBench 等项目上的成绩较高,部分结果超过 Claude Opus 4.6。

这类任务和普通聊天不同。模型需要理解上下文、调用工具、读取执行结果,再继续完成下一步,往往不是一次问答就结束。

所以它更适合放进工作流里持续运行,例如代码修改、资料分析、会议纪要整理、多平台内容生成等任务。

4. 相比上一代,重点是把成本压下来

这次变化里,最值得看的不是单纯提高模型上限,而是效率。

按照官方数据,新架构把训练成本降到了前代的大约九分之一。

模型能力没有走“全面碾压”的路线,但在效果接近甚至部分超过上一代高阶模型的情况下,推理价格明显下降。

这对真正上线的 AI 产品很重要。单次调用差几厘钱可能看不出什么,一旦每天跑几十万次,差距就会被迅速放大。

Qwen3.8-Flash 的思路很明确:性能达到可用水平后,继续降低训练和推理成本。

总结

优势

Qwen3.8-Flash 最大的优势还是性价比。

长上下文、多模态、Agent 和编程能力都比较完整,价格又压得较低。对重复上下文较多的任务,缓存命中后的输入价格还能进一步下降。

它还兼容 OpenAI 和 Anthropic 的主流接口协议,已有项目迁移起来不会太麻烦。

限制

它不是专门追求极限推理能力的模型。

遇到高难度数学、复杂逻辑推理,或者对推理深度要求很高的任务,大型旗舰模型依然可能更强。

开源权重可以本地部署,但云端缓存优惠不会跟着模型权重一起带走。自己部署以后,GPU、显存、推理框架和运维成本都要单独计算。

推荐人群

比较适合开发者、企业技术团队,以及正在做 AI 产品原型的创业团队。

如果你的任务里有大量代码、长文档、Agent 工作流或稳定 API 调用量,Qwen3.8-Flash 会更有价值。

不推荐人群

如果核心需求是追求数学、逻辑推理的最高上限,它未必是首选。

如果业务要求完全离线运行,也不能只看开源免费这一点,还要把本地算力和运维成本一起算进去。

评论(0)

发表评论

Advertisement 728 × 90

Alibaba 模型对比

模型 上下文 定价 API 发布 全球热度
Qwen3.8 Flash
1M $0.150 / $0.470 per 1M YES 2026-08
1M $2.000 / $6.000 per 1M YES 2026-08
88/100
262K $2.000 / $6.000 per 1M YES 2026-08
90/100
262K $0.450 / $3.200 per 1M YES 2026-08
60/100
1M $0.030 / $0.130 per 1M YES 2026-07
79/100

类似模型

Qwen3-235B
99
阿里巴巴 MoE 模型,以 220 亿激活参数实现高质量低成本推理。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.6 Flash
96
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
95
图文输入+文本输出,视觉语言全面升级,同时保留编码和工具调用的完整智能体能力。
Alibaba
Qwen3.8 2.4T A95B
95
比起单纯回答问题,它更大的看点是能不能把一件复杂的事持续做下去。就我自己写代码的体验来说,卡住的时候最需要的不是有人重新讲一遍基础概念,而是能沿着我目前的思路继续往下推。
Alibaba
Qwen3.7 Flash
94
阿里云通义千问推出的新一代 Flash 模型,支持多模态理解、AI Agent、代码开发和高效推理。
Alibaba
Qwen3.8 27B
78
阿里千问团队终于把开源社区等了很久的 Qwen3.8-27B 放了出来。真正让我感兴趣的是它的尺寸:27B。这个体量还没大到只能躺在服务器机房里,量化之后,高端消费级显卡也有机会跑起来;但从代码、Agent 和多模态成绩来看,它已经摸到了顶级闭源模型的门槛。
Alibaba

关联工具