1. 图片和视频不用先绕一圈
Qwen3.7 Flash 能接文本、图片和视频,输出统一是文本。
图片最高支持 1600 万像素。视频最长 2 小时或 2GB,一次请求最多可以放 64 个视频。
这些数字真正省下来的,不只是几步 API 调用。
做视频分析时,最烦的一种方案是先抽帧,再 OCR,再做图像理解,然后把几路结果拼成文本交给语言模型。模型还没开始回答,前处理流程已经写了一长串。
Flash 可以直接接视频后,这一层工程就有机会缩短很多。
图片也是一样。做票据、截图、商品图或者带图表的文档,不必先想办法把所有视觉信息硬转成文字,再祈祷中间没漏掉关键关系。
能直接看,开发端就少很多胶水代码。
2. 1M 上下文真正省的是“切片工程”
100 万 tokens 听起来容易变成一个营销数字。
真正做长文档或者长任务时,它的价值反而很朴素:少切很多段。
上下文不够时,几十万字资料不能直接塞进去,只能先拆文档、做索引、分批检索,再决定哪些片段送给模型。代码库也是同样的问题,文件之间的依赖一多,就得自己维护哪些内容进上下文、哪些内容先丢掉。
这类流程最后经常不是 AI 最复杂,而是外围写满了 chunk、cache、history 和各种判断逻辑。
1M 上下文不能让这些工程问题全部消失,但至少把“窗口装不下”这件事往后推了很多。
再加上 131072 tokens 的最大输出长度,一次任务能读进去的东西多,能吐出来的内容也够长。
对长报告、代码分析、文档抽取这类任务来说,少拆一轮,就少一次信息在拼接过程中丢掉的机会。
3. Agent 场景里,便宜比“聪明一点”更容易被感知
Flash 对 Search Agent、CI Agent 等多模态 Agent 场景做了强化,也加强了多模态 Coding 和 vibe coding。
放到真实产品里,我更在意的不是“Agent 能力增强”这几个字,而是它能不能经得起连续调用。
Agent 和普通聊天最大的不同,是一次用户请求背后可能不是一次模型推理。
它可能先读屏幕,再判断任务,再搜索,再调用工具,拿回结果以后继续判断。用户只点了一下按钮,后台模型已经跑了好几轮。
这时候模型哪怕能力很强,只要每一步都贵,Agent 做出来也很难放量。
Flash 的价格和速度放在这里就比较对路。模型可以参与更多中间判断,不至于每增加一个步骤,都先想到 API 账单。
它还支持 Function Calling、结构化输出和联网搜索。
这几个功能单独拿出来都不新鲜,但组合在一个低成本多模态模型上,价值就比较明确:看完页面以后直接调工具,拿到结果继续执行,中间不用不停换模型。
4. 从 3.6-Flash 到 3.7 Flash,最大的变化是终于“能看了”
Qwen3.6-Flash 更偏轻量文本处理。到了 Qwen3.7 Flash,图片和视频变成原生输入。
这个升级比多几个小功能更容易感知。
文本模型遇到截图时,再聪明也只能等别人先把画面翻译成文字。原生多模态以后,它可以自己看画面里的物体、位置关系和正在发生的事情。
Qwen3.7 Flash 也加强了物体识别、真实世界感知和空间理解。
对普通聊天用户来说,这可能只是“可以发图片了”。
对 Agent 开发者来说差别大得多。
AI 如果要操作电脑、理解网页、分析软件界面,它首先得知道屏幕上有什么。视觉能力从外接模块变成模型原生能力以后,整条链路都会短一些。
评论(0)