Gemini 3.8 Flash

2.65
距离 3.7 Flash 发布才三周,谷歌又把 3.8 Flash 推了出来。更新速度已经够快,更有意思的是,Flash 这次不只是继续拼速度,而是开始认真处理复杂代码、Agent 和专业任务。
Advertisement 728 × 90
公司Google
上下文1M
发布日期2026-09
更新日期2026-09-07

Gemini 3.8 Flash 概述

Gemini 3.8 Flash 在 2026 年 9 月 2 日正式发布,属于 Gemini 3 系列。

它能吃文本、图片、音频和视频,最后输出文本。谷歌给它的定位也很直接——“最智能的干活模型”(most intelligent workhorse model)。

这次它明显更愿意在难题上多花点时间。写代码、做 Agent、处理需要一层层推下去的专业任务,都是它想重点解决的问题。

碰到复杂任务时,它不会急着给一个答案,而是可以多想几步、调用工具、看看结果,再继续往下做。换句话说,Flash 这次开始有点“慢下来想清楚”的意思了,只是整体速度依然很快。

另外,谷歌还一起推出了 Gemini 3.8 Flash Cyber,专门针对网络安全场景,可以用来发现漏洞和进行自动修复。这个版本通过 Fairwind 计划提供给受信任的安全团队。

Gemini 3.8 Flash 定价

套餐价格说明
免费版 $0/月 可以使用 Gemini 基础功能,但不能使用 Gemini 3.8 Flash
AI Plus $7.99/月 适合日常使用和轻量 AI 任务,但不支持 Gemini 3.8 Flash
AI Pro $19.99/月 支持 Gemini 3.8 Flash,适合开发、复杂推理和高频使用
AI Ultra $99.99/月或 $199.99/月 支持 Gemini 3.8 Flash,更适合高强度 AI 使用和专业用户
API 按量计费 2026 年 12 月 31 日前,输入 $0.75/百万 token、输出 $3.75/百万 token;2027 年 1 月 1 日起分别为 $1.50 和 $7.50

API 的缓存输入按正常输入价格的 10% 收费。

这里开发者要留意一个时间点:促销价格只到 2026 年 12 月 31 日,之后输入和输出价格都会翻倍。

而 3.8 Flash 又比 3.7 Flash 更舍得花 token 去推理,所以真正长期用起来,不能只盯着眼前这组价格。

Gemini 3.8 Flash 主要功能

1. 写代码这件事,确实认真了不少

这是 3.8 Flash 最值得看的变化。

DeepSWE v1.1 中,3.8 Flash 得分 73.7%,3.7 Flash 是 65.3%,距离 Claude Opus 5 的 74.0% 只差 0.3 个百分点。

Terminal-Bench 2.1 的成绩更有意思:89.4%,超过 Opus 5 的 89.1%。

所以 Flash 现在已经不只是拿来写几段简单代码了。复杂开发、命令行操作和 Agent 任务,都开始成为它的主要战场。

2. 专业任务也开始往上冲

金融和法律是两个比较明显的例子。

在 Vals Finance Agent V2 和 Harvey's Legal Agent Benchmark 中,3.8 Flash 都超过了 3.7 Flash 和 Claude Opus 5。

HLE-Verified 得分 54.9%,覆盖 STEM、人文等多个领域。

这里不用把它想成“什么专业问题都能解决”。更实际一点看,它处理那种需要连续分析、一步接一步完成的工作,确实更有底气了。

3. 推理强度可以自己控制

3.8 Flash 提供低、中、高三个 thinking effort 档位。

第三方测试中,高档智力指数为 59 分,中档 57 分,低档 52 分。

这个设置对开发者挺实用。简单任务没必要一直开高推理,遇到复杂代码、长流程 Agent,再把强度调上去。效果、响应时间和 token 消耗,可以自己做取舍。

4. 多想了几步,速度也没有掉得太难看

3.8 Flash 的输出速度约 300 token/秒,约为许多主流模型的 4 到 6 倍。

p50 延迟测试中,比 3.6 Flash 快约 52%。

所以这次并不是单纯拿速度换推理能力。Flash 原本的速度优势还在,只是谷歌开始让它把更多计算用到复杂任务上。

⚡ 与上一代 Gemini 3.7 Flash 的进化

这次并不是把 3.7 Flash 推倒重做。

3.8 Flash 还是沿着 3.7 Flash 的技术路线往前走,模型架构、训练数据集、硬件和软件这些底层东西没有全面换一套。

真正明显的变化,在于它干活的方式。

遇到复杂任务,它会多想几步,调用工具,检查结果,再继续往下做。14 组 Benchmark 里,3.8 Flash 拿下了 8 个第一。

代价也很直接:单任务成本比 3.7 Flash 高约 40%。

所以这次升级到底值不值,还是得看任务。

写个简单函数,未必需要它多想那么久;但如果是复杂代码库、长流程 Agent 或专业分析,多出来的这部分推理能力就更有意义。

总结

优势

  • 软件工程、Agent 和专业分析能力明显增强
  • DeepSWE v1.1 达到 73.7%,Terminal-Bench 2.1 达到 89.4%
  • 输出速度约 300 token/秒
  • 支持 100 万 token 上下文窗口,可处理约 1500 页 A4 文档
  • 提供低、中、高三档 thinking effort
  • API 促销期价格与 3.7 Flash 相同

限制

真正让我犹豫的还是价格。

复杂任务本身就更容易消耗 token,而 3.8 Flash 单任务成本又比 3.7 Flash 高约 40%。如果每天大量跑 Agent,这个差距最后会很明显。

另外,Gemini App 只有 Pro 和 Ultra 能用 3.8 Flash。API 的促销价格也只到 2026 年 12 月 31 日,之后输入和输出价格直接翻倍。

还有一个很现实的问题:Benchmark 看着挺美,实际跑起来是另一回事。

有评测发现,3.8 Flash 可以在两三分钟内生成能够运行的 3D 场景代码,但最后的效果仍然可能是“能跑,但不对”。所以分数很漂亮,不代表丢进真实项目里就能一路顺滑。

推荐人群

如果你经常写复杂代码、做 Agent,或者手里的任务本身就需要模型一层层分析,3.8 Flash 值得考虑。

金融、法律这类需要连续处理信息的场景,也可以重点看看。

企业用户则要多算一步账。如果任务足够复杂,多花一些 token 能明显减少人工处理时间,那这笔成本未必贵。

不推荐人群

如果平时只是聊天、摘要、简单改写,3.8 Flash 有点用力过猛。

API 成本卡得比较紧的开发者,也没必要急着换。很多简单任务,3.7 Flash 已经能做得很好。

如果只是想尝鲜,又不想升级 Pro,那也可以先等等。

我觉得谷歌这次走得挺明显:Flash 已经不满足于当一个“又快又便宜”的模型了。

它开始认真抢复杂任务的生意。

这当然是好事,只是谷歌也顺手把另一件事摆到了桌面上——模型越会想,账单也越容易变聪明。

评论(0)

发表评论

Advertisement 728 × 90

Google 模型对比

模型 上下文 定价 API 发布 全球热度
Gemini 3.8 Flash
1M $0.750 / $3.750 per 1M YES 2026-09
98/100
1M $0.375 / $1.875 per 1M YES 2026-08
95/100
1M $1.500 / $7.500 per 1M YES 2026-07
97/100
1M $0.300 / $2.500 per 1M YES 2026-07
72/100
131K $0.500 / $3.000 per 1M YES 2026-06
80/100

类似模型

关联工具

相关新闻