1. 三种图片输入方式
一共有三种方式,没有什么特别新的协议,基本都是开发者熟悉的路子。
Base64 内联
直接把本地图片编码后塞进请求。
用起来最直接,适合临时测试或者小文件,不过整个请求体有 48 MiB 限制。图片一大,Base64 本身又会膨胀,长期用并不算优雅。
外部 URL
给模型一个公开可访问的图片链接,由服务端自己下载。
省事,但图片不能超过 32 MiB,而且链接必须能正常访问。
Files API
先上传,再通过 file_id 调用。
单张支持到 64 MiB,也是三种方式里限制最宽松的一种。如果同一张图会被多次使用,优先选这个就行。
2. Agent 能看结果了
单独做图片理解,其实不算什么新鲜能力。
这次比较值得看的,是视觉能力被直接接进了 Agent 工作流。
DeepSeek 给出的几个案例都不是传统的“上传一张图,告诉我里面有什么”。
比如生成西藏自驾游高端定制 PPT,模型需要理解“野性、粗粝”这种很难用硬指标描述的视觉要求,再把这种感觉落实到最终页面里。
还有 DeepSeek Harness 官网的视觉风格二创,以及黏土怪物风格的前端 Demo。
这类任务麻烦的地方一直不在第一次生成,而在于生成之后怎么办。
纯文本 Agent 可以写代码、改代码、调用工具,但网页到底丑不丑,排版有没有崩,图表是不是挤成一团,它自己看不到。
这就很尴尬。
代码写得再勤快,最后视觉效果翻车,它也只能继续盲改。
Vision-Exp 补上的正是这一环:Agent 可以看到自己做出来的东西。
看完,再改。
对网页、PPT、前端、图表这类任务来说,这个能力比单纯“识图”更有价值。
3. 基准测试也有提升
官方给了几组多模态 Agent 测试。
ApexBench(Pass@1)
- V4-Flash-Vision-Exp:36.5
- V4-Flash:26.2
- Claude Opus-4.8:39.4
Agents' Last Exam
- V4-Flash-Vision-Exp:27.3
- V4-Flash:25.2
- Claude Opus-4.8:25.7
Chartography
- V4-Flash-Vision-Exp:64.3
- Claude Opus-4.8:65.0
ZeroBench(Pass@5)
- V4-Flash-Vision-Exp:35.0
- Claude Opus-4.8:34.0
四项放在一起看,和 Claude Opus-4.8 基本是互有胜负。
ApexBench 和 Agents' Last Exam 里本身包含多模态内容,而旧 V4-Flash 不支持图像,这部分信息会被直接忽略。
所以 Vision-Exp 从 26.2 涨到 36.5,不能简单理解成“模型突然聪明了 10 分”,更准确地说,是它终于拿到了原本缺失的视觉信息。
纯文本 Agent 测试也有几项上涨:
- Terminal Bench 2.1:82.7 → 83.9
- DeepSWE:54.4 → 59.3
- DSBench-Hard:59.6 → 63.6
至少从这组数据看,加视觉没有把原来的文本 Agent 能力拖下去,反而有几项还往上走了一点。
4. 补上 V4 的关键缺口
V4-Flash-0731 是纯文本模型。
放在聊天场景里问题不算大,但一旦用来做 Agent,限制很快就会冒出来。
网页截图看不了。
图表看不了。
UI 做完没法检查。
PPT 生成之后,也没法判断版式和视觉风格到底对不对。
很多自动化任务做到最后都会碰到一个现实问题:Agent 把东西生成出来了,但它不知道自己生成得怎么样。
有了视觉之后,它至少能看一眼结果,再决定下一步怎么改。
这才是 Vision-Exp 真正补上的东西。
评论(0)