DeepSeek V4 Flash Vision Exp

DeepSeek 8 月 21 日在 API 平台上线了一个新模型:DeepSeek-V4-Flash-Vision-Exp。 名字有点长,核心其实就一件事——V4-Flash 能看图了。
Advertisement 728 × 90
公司DeepSeek
上下文1M
发布日期2026-08
更新日期2026-08-28

DeepSeek V4 Flash Vision Exp 概述

先别被名字里的 Vision 吓到,它并不是重新做了一套独立视觉模型。

DeepSeek-V4-Flash-Vision-Exp 还是基于 V4-Flash,只是在原来的文本、推理、Agent 和知识能力上,多了一双“眼睛”。

所以你可以把它理解成:V4-Flash + 图像理解。

至于名字最后那个 Exp,就是 Experimental,实验版。

底层还是稀疏 MoE 架构,总参数 284B,实际每次激活 13B。这个数字本身不用太纠结,比较值得关注的是后半句:它没有因为加视觉能力,就把推理成本直接拉高一档。

现在它能接 JPEG、PNG、GIF、WebP,也支持图文混合输入。上下文最高 1M token,最大输出 384K token。

API 这边也没另起炉灶,JSON Output、Tool Calls、Responses API、Anthropic API 格式都能继续用。

换句话说,这不是网页版多了一个“识图按钮”,而是 DeepSeek 第一次把 V4 的视觉能力真正塞进 API。

对普通用户来说区别不算大,对做 Agent 的开发者来说就不是一回事了。

DeepSeek V4 Flash Vision Exp 定价

套餐价格说明
缓存命中输入 空闲 0.05 元/百万 Token;高峰 0.10 元/百万 Token 重复上下文命中缓存后走这一档,固定提示词、多轮复用会比较省
缓存未命中输入 空闲 1.50 元/百万 Token;高峰 3.00 元/百万 Token 新输入按这一档计算,图片换算成 Token 后也算在这里
输出 空闲 4.50 元/百万 Token;高峰 9.00 元/百万 Token 按模型实际生成的 Token 数计费
Files API 免费 图片上传后可以通过 file_id 反复引用,单张最大 64 MiB

图片不是按“张”收费,而是先折算成 Token。

单张图片最多占 384 Token。按高峰时段、缓存未命中输入价算:

384 × 3 ÷ 1,000,000 ≈ 0.00115 元

也就是说,即便按最高图片 Token 数去算,一张图的输入成本也只有千分之一元左右。

这个价格确实有点狠。

并发限制还是 2500,和 V4-Flash 一样,没有因为多模态单独砍并发。

Files API 也不收费。图片传上去以后,后面的请求直接拿 file_id 引用就行,不用每次重新塞一遍。

如果一个 Agent 要反复看同一张截图、设计稿或者图表,这种方式比反复传 Base64 顺手得多。

DeepSeek V4 Flash Vision Exp 主要功能

1. 三种图片输入方式

一共有三种方式,没有什么特别新的协议,基本都是开发者熟悉的路子。

Base64 内联

直接把本地图片编码后塞进请求。

用起来最直接,适合临时测试或者小文件,不过整个请求体有 48 MiB 限制。图片一大,Base64 本身又会膨胀,长期用并不算优雅。

外部 URL

给模型一个公开可访问的图片链接,由服务端自己下载。

省事,但图片不能超过 32 MiB,而且链接必须能正常访问。

Files API

先上传,再通过 file_id 调用。

单张支持到 64 MiB,也是三种方式里限制最宽松的一种。如果同一张图会被多次使用,优先选这个就行。

2. Agent 能看结果了

单独做图片理解,其实不算什么新鲜能力。

这次比较值得看的,是视觉能力被直接接进了 Agent 工作流。

DeepSeek 给出的几个案例都不是传统的“上传一张图,告诉我里面有什么”。

比如生成西藏自驾游高端定制 PPT,模型需要理解“野性、粗粝”这种很难用硬指标描述的视觉要求,再把这种感觉落实到最终页面里。

还有 DeepSeek Harness 官网的视觉风格二创,以及黏土怪物风格的前端 Demo。

这类任务麻烦的地方一直不在第一次生成,而在于生成之后怎么办。

纯文本 Agent 可以写代码、改代码、调用工具,但网页到底丑不丑,排版有没有崩,图表是不是挤成一团,它自己看不到。

这就很尴尬。

代码写得再勤快,最后视觉效果翻车,它也只能继续盲改。

Vision-Exp 补上的正是这一环:Agent 可以看到自己做出来的东西。

看完,再改。

对网页、PPT、前端、图表这类任务来说,这个能力比单纯“识图”更有价值。

3. 基准测试也有提升

官方给了几组多模态 Agent 测试。

ApexBench(Pass@1)

  • V4-Flash-Vision-Exp:36.5
  • V4-Flash:26.2
  • Claude Opus-4.8:39.4

Agents' Last Exam

  • V4-Flash-Vision-Exp:27.3
  • V4-Flash:25.2
  • Claude Opus-4.8:25.7

Chartography

  • V4-Flash-Vision-Exp:64.3
  • Claude Opus-4.8:65.0

ZeroBench(Pass@5)

  • V4-Flash-Vision-Exp:35.0
  • Claude Opus-4.8:34.0

四项放在一起看,和 Claude Opus-4.8 基本是互有胜负。

ApexBench 和 Agents' Last Exam 里本身包含多模态内容,而旧 V4-Flash 不支持图像,这部分信息会被直接忽略。

所以 Vision-Exp 从 26.2 涨到 36.5,不能简单理解成“模型突然聪明了 10 分”,更准确地说,是它终于拿到了原本缺失的视觉信息。

纯文本 Agent 测试也有几项上涨:

  • Terminal Bench 2.1:82.7 → 83.9
  • DeepSWE:54.4 → 59.3
  • DSBench-Hard:59.6 → 63.6

至少从这组数据看,加视觉没有把原来的文本 Agent 能力拖下去,反而有几项还往上走了一点。

4. 补上 V4 的关键缺口

V4-Flash-0731 是纯文本模型。

放在聊天场景里问题不算大,但一旦用来做 Agent,限制很快就会冒出来。

网页截图看不了。

图表看不了。

UI 做完没法检查。

PPT 生成之后,也没法判断版式和视觉风格到底对不对。

很多自动化任务做到最后都会碰到一个现实问题:Agent 把东西生成出来了,但它不知道自己生成得怎么样。

有了视觉之后,它至少能看一眼结果,再决定下一步怎么改。

这才是 Vision-Exp 真正补上的东西。

总结

如果已经在用 V4-Flash 做 Agent,这个版本值得试。

原因很直接:调用方式变化不大,视觉能力加进来了,价格还是原来的价格。

尤其是网页、截图、图表、UI、PPT 这一类任务,原来的 V4-Flash 很容易卡在“看不到结果”这一关,Vision-Exp 至少把这个限制拆掉了。

但别忘了名字最后还有个 Exp

实验版就是实验版,稳定性和边缘场景表现还得继续看。

人物识别就是一个例子,已经有测试出现过把梁文锋认成其他人的情况。如果业务对人物身份识别准确率要求很高,这个模型并不适合直接拿来做判断。

另外,它只开放 API,没有单独的网页版入口。

如果只是偶尔让 AI 读一张图片,没必要为了它专门折腾 API。

但如果你本来就在做 Agent,而且任务里经常出现截图、网页、图表或者 UI,V4-Flash-Vision-Exp 就比较有吸引力了。

V4-Flash 多了一双眼睛,账单却没跟着变厚。

评论(0)

发表评论

Advertisement 728 × 90

DeepSeek 模型对比

模型 上下文 定价 API 发布 全球热度
DeepSeek V4 Flash Vision Exp
1M $0.440 / $1.320 per 1M YES 2026-08
1M $0.435 / $0.870 per 1M YES 2026-08
96/100
1M $0.090 / $0.180 per 1M YES 2026-07
87/100
1M $0.435 / $0.870 per 1M NO 2026-04
90/100
128K 免费增值 YES 2025-05
96/100

类似模型

相关新闻