Qwen3.7 Flash

4.60
第一次看到“Flash”,我以为它只是个跑得快、能力做了取舍的小模型。结果看参数:文本、图片、视频都能处理,1M 上下文,还针对 Agent 做了优化。更夸张的是价格——32K 以内,100 万输入 tokens 只要 0.2 元。这个“Flash”,砍的是延迟和成本,不是能力。
Advertisement 728 × 90
公司Alibaba
上下文1M
发布日期2026-07
更新日期2026-09-09

Qwen3.7 Flash 概述

Qwen3.7 Flash 是阿里云在 2026 年 7 月 15 日推出的通义千问 3.7 系列轻量高速模型。它是一款原生视觉语言模型,可以直接吃文本、图片和视频,最后输出文本。

Qwen3.7 系列一共有三款。

Max 是纯文本旗舰,复杂推理交给它;Plus 更像能力铺得比较全的多模态主力;Flash 则明显在做另一件事:让模型调用得足够快,也足够便宜。

这点对生产环境其实比“又涨了几个榜单分数”更现实。

如果一个 Agent 每完成一次任务要调模型很多次,单次价格哪怕只差一点,乘上每天的请求量以后都会变成真金白银。Flash 的价值就在这里——你可以更大胆地让模型参与中间步骤,而不是每次都琢磨这一步能不能省掉。

它采用轻量化 MoE(混合专家)架构,推理时只激活部分参数。上下文窗口做到 1M tokens,最大输出长度 131072 tokens,也可以在思考模式(enable_thinking)和快速模式之间切换。

服务通过阿里云百炼提供,API 兼容 OpenAI 格式。

如果团队手里已经有一套按 OpenAI API 写好的调用逻辑,这一点很实际:没必要为了换一个模型,把接口层重新折腾一遍。

语言以中文和英文为主。

Qwen3.7 Flash 定价

套餐价格说明
新用户免费额度 100 万 Tokens 免费 有效期至 2026 年 10 月 23 日
按量付费(输入 ≤32K) 输入 ¥0.2 / 百万 tokens,输出 ¥0.8 / 百万 tokens 标准实时调用
按量付费(32K<输入≤256K) 输入 ¥0.6 / 百万 tokens,输出 ¥2.4 / 百万 tokens 中长文本
按量付费(256K<输入≤1M) 输入 ¥1.2 / 百万 tokens,输出 ¥4.8 / 百万 tokens 超长上下文
缓存命中 输入低至 ¥0.04 / 百万 tokens 重复请求可享受更低价格
批量推理 实时推理价格的 50% 适合离线、大规模任务

国际站价格不完全一样,输入最低约 $0.028 / 百万 tokens,输出约 $0.11 / 百万 tokens,不同地域也会有差异。

如果只是个人开发,100 万 Tokens 的新用户额度足够先把接口、提示词和几个真实任务跑起来,没必要一开始就充值验证想法。

Qwen3.7 Flash 主要功能

1. 图片和视频不用先绕一圈

Qwen3.7 Flash 能接文本、图片和视频,输出统一是文本。

图片最高支持 1600 万像素。视频最长 2 小时或 2GB,一次请求最多可以放 64 个视频。

这些数字真正省下来的,不只是几步 API 调用。

做视频分析时,最烦的一种方案是先抽帧,再 OCR,再做图像理解,然后把几路结果拼成文本交给语言模型。模型还没开始回答,前处理流程已经写了一长串。

Flash 可以直接接视频后,这一层工程就有机会缩短很多。

图片也是一样。做票据、截图、商品图或者带图表的文档,不必先想办法把所有视觉信息硬转成文字,再祈祷中间没漏掉关键关系。

能直接看,开发端就少很多胶水代码。

2. 1M 上下文真正省的是“切片工程”

100 万 tokens 听起来容易变成一个营销数字。

真正做长文档或者长任务时,它的价值反而很朴素:少切很多段。

上下文不够时,几十万字资料不能直接塞进去,只能先拆文档、做索引、分批检索,再决定哪些片段送给模型。代码库也是同样的问题,文件之间的依赖一多,就得自己维护哪些内容进上下文、哪些内容先丢掉。

这类流程最后经常不是 AI 最复杂,而是外围写满了 chunk、cache、history 和各种判断逻辑。

1M 上下文不能让这些工程问题全部消失,但至少把“窗口装不下”这件事往后推了很多。

再加上 131072 tokens 的最大输出长度,一次任务能读进去的东西多,能吐出来的内容也够长。

对长报告、代码分析、文档抽取这类任务来说,少拆一轮,就少一次信息在拼接过程中丢掉的机会。

3. Agent 场景里,便宜比“聪明一点”更容易被感知

Flash 对 Search Agent、CI Agent 等多模态 Agent 场景做了强化,也加强了多模态 Coding 和 vibe coding。

放到真实产品里,我更在意的不是“Agent 能力增强”这几个字,而是它能不能经得起连续调用。

Agent 和普通聊天最大的不同,是一次用户请求背后可能不是一次模型推理。

它可能先读屏幕,再判断任务,再搜索,再调用工具,拿回结果以后继续判断。用户只点了一下按钮,后台模型已经跑了好几轮。

这时候模型哪怕能力很强,只要每一步都贵,Agent 做出来也很难放量。

Flash 的价格和速度放在这里就比较对路。模型可以参与更多中间判断,不至于每增加一个步骤,都先想到 API 账单。

它还支持 Function Calling、结构化输出和联网搜索。

这几个功能单独拿出来都不新鲜,但组合在一个低成本多模态模型上,价值就比较明确:看完页面以后直接调工具,拿到结果继续执行,中间不用不停换模型。

4. 从 3.6-Flash 到 3.7 Flash,最大的变化是终于“能看了”

Qwen3.6-Flash 更偏轻量文本处理。到了 Qwen3.7 Flash,图片和视频变成原生输入。

这个升级比多几个小功能更容易感知。

文本模型遇到截图时,再聪明也只能等别人先把画面翻译成文字。原生多模态以后,它可以自己看画面里的物体、位置关系和正在发生的事情。

Qwen3.7 Flash 也加强了物体识别、真实世界感知和空间理解。

对普通聊天用户来说,这可能只是“可以发图片了”。

对 Agent 开发者来说差别大得多。

AI 如果要操作电脑、理解网页、分析软件界面,它首先得知道屏幕上有什么。视觉能力从外接模块变成模型原生能力以后,整条链路都会短一些。

总结

我觉得 Qwen3.7 Flash 最值得看的不是某一个参数,而是这几个数字放在一起:

1M 上下文、文本/图片/视频输入、最低 ¥0.2 / 百万输入 tokens,再加上 Agent 能力。

单独拿出任何一个,都不算特别稀奇。

放在一起以后,使用方式会发生变化。

调用贵的时候,开发者会下意识减少模型参与次数;上下文短的时候,会花大量精力做切片;不支持视觉的时候,又要外接图片和视频模型。

Flash 没把这些问题全部消灭,但它至少把其中几项成本压低了。

它的限制也得算进去。

输出只有文本,所以想让模型直接生成图片或者视频,不是它的工作。Fine-tuning 也不支持。如果项目强依赖模型微调,看到这里基本就可以换候选了。

纯视觉能力也不是它最适合拿来拼排名的方向。

但如果你做的是 Agent、图文文档处理、视频理解,或者每天都有大量请求需要跑,我会优先拿 Flash 做一轮实际成本测试。

原因并不复杂。

一个模型便不便宜,真正重要的不是 Demo 跑一次省了多少钱,而是上线以后,你敢不敢让请求量继续往上涨。

Qwen3.7 Flash 给我的感觉就是:至少在 API 成本这一项上,团队可以少紧张一点。

至于纯文本项目,就没必要为了“1M+多模态”多绕一圈。需要图片、视频生成的产品也直接排除。

它最合适的位置,还是那些调用次数多、上下文长,而且模型真的需要看东西的任务。

评论(0)

发表评论

Advertisement 728 × 90

Alibaba 模型对比

模型 上下文 定价 API 发布 全球热度
Qwen3.7 Flash
1M $0.030 / $0.130 per 1M YES 2026-07
81/100
1M $2.000 / $6.000 per 1M YES 2026-09
1M $2.000 / $6.000 per 1M YES 2026-08
87/100
262K $2.000 / $6.000 per 1M YES 2026-08
90/100
262K $0.450 / $3.200 per 1M YES 2026-08
60/100

类似模型

Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
96
个人认为Qwen3.7 Plus是阿里开始把多模态 Agent 真正往“干活”这件事上推了。 它能看屏幕、操作界面、写代码,再自己检查结果。单项能力未必最强,但把这些事串起来之后,实用性反而更值得看。
Alibaba
Qwen3.8 2.4T A95B
95
比起单纯回答问题,它更大的看点是能不能把一件复杂的事持续做下去。就我自己写代码的体验来说,卡住的时候最需要的不是有人重新讲一遍基础概念,而是能沿着我目前的思路继续往下推。
Alibaba
Qwen3.8 27B
78
阿里千问团队终于把开源社区等了很久的 Qwen3.8-27B 放了出来。真正让我感兴趣的是它的尺寸:27B。这个体量还没大到只能躺在服务器机房里,量化之后,高端消费级显卡也有机会跑起来;但从代码、Agent 和多模态成绩来看,它已经摸到了顶级闭源模型的门槛。
Alibaba

关联工具