1. 视觉能力并入主模型
V4 Flash Vision Exp 处理图片时还需要额外的视觉模块。
V4.1 Flash 直接把视觉能力放进了主模型。
文字、图片、截图和图表可以一起输入,也不需要单独再接一套视觉模型。
比如做报表分析,可以先读截图,再识别图表,接着继续整理数据或调用工具。
开发流程会更短一些。
复杂 UI、小字和高密度图表的表现,还是要单独测。不同视觉任务之间的难度差异很大。
2. 100 万 Token 还在,速度快了
上下文窗口仍然是 100 万 Token。
官方公布的 49K 长上下文检索测试里,V4.1 Flash 的速度达到 V4 Flash Vision Exp 的 5.2 倍,SVG 代码生成约快 6 倍。
这类提升放到长文档和大型代码库里会更实用。
几十万 Token 能不能塞进去,已经不是太大的问题。更麻烦的是每次读取要等多久。
Agent 连续跑很多步时,单次等待时间一长,整条链路都会被拖慢。
3. 输入和输出用了不同规模的算力
V4.1 Flash 读取输入时约激活 8B 参数,开始生成后提高到 16B。
代码分析、RAG、企业知识库里,经常会碰到“大量输入、少量输出”的情况。
比如一个代码仓库可能有几十万 Token,最后的修改建议只有几千 Token。知识库也差不多,输入资料很多,最终答案很短。
这种场景下,输入阶段的计算开销会直接影响长期成本。
V4.1 Flash 这次把输入端的激活规模和价格都往下压了。
4. 和 V4 Flash 比,改了这些
- 参数规模提高到 552B
- 采用 Causal-Encoder-Decoder 架构
- 视觉能力整合进主模型
- 长上下文处理速度提高
- API 输入、输出价格下降
公开成绩包括:
- GPQA Diamond:90.9
- Codeforces:3471
- Terminal-Bench 2.1:90.6
部分项目已经超过 V4 Pro 公布的数据。
Flash 一般容易让人想到更快、更便宜,也会顺带牺牲一点性能。V4.1 Flash 从公开结果看,没有明显掉到轻量模型那一档。
这还不能直接等同于生产环境表现。
Agent 连续调用几十次工具之后是否稳定,大型代码库能不能一直保持准确,跑完一次完整任务到底用了多少 Token,都得单独记录。
评论(0)