DeepSeek V4.1 Flash

4.80
DeepSeek V4.1 Flash 接替 Pro 后,改动不算小。 参数规模到了 552B,支持 100 万 Token 上下文,视觉能力也放进了主模型。API 价格则继续往下调,输入和缓存部分降得最明显。 公开测试里,部分成绩已经超过 V4 Pro。
Advertisement 728 × 90
公司DeepSeek
上下文1M
发布日期2026-09
更新日期2026-09-10

DeepSeek V4.1 Flash 概述

DeepSeek V4.1 Flash 是一款 552B 参数的 MoE(混合专家)模型,采用 Causal-Encoder-Decoder 架构。

读取输入时约激活 8B 参数,生成内容时约激活 16B 参数。

上下文窗口为 100 万 Token,最大输出长度 384K Token。

模型可以处理文本、图片、截图和图表,也支持 JSON 输出、工具调用、Responses API,以及 low、high、max 三档思考模式。

长文档、代码库、Agent、知识库和图文混合任务,都可以直接交给这一个模型处理。

DeepSeek V4.1 Flash 定价

套餐价格说明
API 输入(缓存命中) 空闲时段 0.02 元 / 百万 Token;高峰时段 0.04 元 / 百万 Token 适合重复读取相同上下文
API 输入(缓存未命中) 空闲时段 1 元 / 百万 Token;高峰时段 2 元 / 百万 Token 按实际输入 Token 计费
API 输出 空闲时段 4 元 / 百万 Token;高峰时段 8 元 / 百万 Token 按实际生成 Token 计费
网页端 / App 免费 聊天、写作、资料整理等日常使用

工作日 9:00–12:00、14:00–18:00 为高峰时段,其余时间执行空闲价格。

和 V4 Flash 相比:

  • 缓存命中输入价格下降 60%
  • 缓存未命中输入价格下降 33%
  • 输出价格下降 11%

DeepSeek V4.1 Flash 主要功能

1. 视觉能力并入主模型

V4 Flash Vision Exp 处理图片时还需要额外的视觉模块。

V4.1 Flash 直接把视觉能力放进了主模型。

文字、图片、截图和图表可以一起输入,也不需要单独再接一套视觉模型。

比如做报表分析,可以先读截图,再识别图表,接着继续整理数据或调用工具。

开发流程会更短一些。

复杂 UI、小字和高密度图表的表现,还是要单独测。不同视觉任务之间的难度差异很大。

2. 100 万 Token 还在,速度快了

上下文窗口仍然是 100 万 Token

官方公布的 49K 长上下文检索测试里,V4.1 Flash 的速度达到 V4 Flash Vision Exp 的 5.2 倍,SVG 代码生成约快 6 倍

这类提升放到长文档和大型代码库里会更实用。

几十万 Token 能不能塞进去,已经不是太大的问题。更麻烦的是每次读取要等多久。

Agent 连续跑很多步时,单次等待时间一长,整条链路都会被拖慢。

3. 输入和输出用了不同规模的算力

V4.1 Flash 读取输入时约激活 8B 参数,开始生成后提高到 16B

代码分析、RAG、企业知识库里,经常会碰到“大量输入、少量输出”的情况。

比如一个代码仓库可能有几十万 Token,最后的修改建议只有几千 Token。知识库也差不多,输入资料很多,最终答案很短。

这种场景下,输入阶段的计算开销会直接影响长期成本。

V4.1 Flash 这次把输入端的激活规模和价格都往下压了。

4. 和 V4 Flash 比,改了这些

  • 参数规模提高到 552B
  • 采用 Causal-Encoder-Decoder 架构
  • 视觉能力整合进主模型
  • 长上下文处理速度提高
  • API 输入、输出价格下降

公开成绩包括:

  • GPQA Diamond:90.9
  • Codeforces:3471
  • Terminal-Bench 2.1:90.6

部分项目已经超过 V4 Pro 公布的数据。

Flash 一般容易让人想到更快、更便宜,也会顺带牺牲一点性能。V4.1 Flash 从公开结果看,没有明显掉到轻量模型那一档。

这还不能直接等同于生产环境表现。

Agent 连续调用几十次工具之后是否稳定,大型代码库能不能一直保持准确,跑完一次完整任务到底用了多少 Token,都得单独记录。

总结

优势

  • API 价格低
  • 支持 100 万 Token 上下文
  • 长上下文处理速度更快
  • 视觉能力已经并入主模型
  • 部分公开成绩超过 V4 Pro

限制

  • 生产环境数据还不够多
  • 超长上下文依然会消耗大量 Token
  • 复杂视觉任务需要单独测试
  • API 存在峰谷价格差

推荐人群

  • Agent、RAG、企业知识库开发者
  • 经常处理大型代码库的团队
  • 有大量长文档分析需求的企业
  • API 调用量较大的项目
  • 同时需要文本和视觉输入的应用

不推荐人群

  • 主要用于聊天和普通写作的用户
  • API 调用量很小的个人开发者
  • 不需要长上下文的轻量应用
  • 只追求最高性能、不太考虑成本的项目

评论(0)

发表评论

Advertisement 728 × 90

类似模型

Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
阿里巴巴 MoE 模型,以 220 亿激活参数实现高质量低成本推理。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
96
图文输入+文本输出,视觉语言全面升级,同时保留编码和工具调用的完整智能体能力。
Alibaba
Kimi K3
96
Moonshot AI 最新旗舰模型,具备超长上下文、多模态理解和智能 Agent 任务执行能力。
Moonshotai

相关新闻