1. 写代码这件事,确实认真了不少
这是 3.8 Flash 最值得看的变化。
DeepSWE v1.1 中,3.8 Flash 得分 73.7%,3.7 Flash 是 65.3%,距离 Claude Opus 5 的 74.0% 只差 0.3 个百分点。
Terminal-Bench 2.1 的成绩更有意思:89.4%,超过 Opus 5 的 89.1%。
所以 Flash 现在已经不只是拿来写几段简单代码了。复杂开发、命令行操作和 Agent 任务,都开始成为它的主要战场。
2. 专业任务也开始往上冲
金融和法律是两个比较明显的例子。
在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 中,3.8 Flash 都超过了 3.7 Flash 和 Claude Opus 5。
HLE-Verified 得分 54.9%,覆盖 STEM、人文等多个领域。
这里不用把它想成“什么专业问题都能解决”。更实际一点看,它处理那种需要连续分析、一步接一步完成的工作,确实更有底气了。
3. 推理强度可以自己控制
3.8 Flash 提供低、中、高三个 thinking effort 档位。
第三方测试中,高档智力指数为 59 分,中档 57 分,低档 52 分。
这个设置对开发者挺实用。简单任务没必要一直开高推理,遇到复杂代码、长流程 Agent,再把强度调上去。效果、响应时间和 token 消耗,可以自己做取舍。
4. 多想了几步,速度也没有掉得太难看
3.8 Flash 的输出速度约 300 token/秒,约为许多主流模型的 4 到 6 倍。
p50 延迟测试中,比 3.6 Flash 快约 52%。
所以这次并不是单纯拿速度换推理能力。Flash 原本的速度优势还在,只是谷歌开始让它把更多计算用到复杂任务上。
⚡ 与上一代 Gemini 3.7 Flash 的进化
这次并不是把 3.7 Flash 推倒重做。
3.8 Flash 还是沿着 3.7 Flash 的技术路线往前走,模型架构、训练数据集、硬件和软件这些底层东西没有全面换一套。
真正明显的变化,在于它干活的方式。
遇到复杂任务,它会多想几步,调用工具,检查结果,再继续往下做。14 组 Benchmark 里,3.8 Flash 拿下了 8 个第一。
代价也很直接:单任务成本比 3.7 Flash 高约 40%。
所以这次升级到底值不值,还是得看任务。
写个简单函数,未必需要它多想那么久;但如果是复杂代码库、长流程 Agent 或专业分析,多出来的这部分推理能力就更有意义。
评论(0)