Gemini 3.1 Flash Lite

2.70
谷歌轻量级多模态模型,支持图文音视频及PDF,主打低延迟、高吞吐,适用于规模化Agent场景。
Advertisement 728 × 90
公司Google
上下文1M
发布日期2026-05
更新日期2026-08-17

Gemini 3.1 Flash Lite 概述

Gemini 3.1 Flash Lite 是谷歌2026年3月发布的轻量级多模态模型,定价$0.25/百万输入token、$1.50/百万输出token,支持100万token上下文及图文音视频PDF多模态输入,并提供4档思考等级调节。Arena评分1432分,GPQA Diamond达86.9%,首字响应速度提升2.5倍,输出速度提升45%。适用于大批量翻译、内容审核、数据提取、UI生成等规模化Agent场景,可通过Google AI Studio或Vertex AI获取。

Gemini 3.1 Flash Lite 定价

套餐价格说明
API 按量付费版 输入 $0.25 / 输出 $1.50 每百万 Tokens 按实际 API 使用量计费。支持 100 万 Token 上下文窗口,输出价格包含思考 Token 费用。音频输入价格为 $0.50/百万 Tokens。适合高性价比 AI 应用开发。
API Batch / Flex 模式 输入 $0.125 / 输出 $0.75 每百万 Tokens 批处理与弹性处理模式,价格约为标准 API 的 50%。适合大规模数据处理和非实时任务。
API 免费层 免费(有限额度) Google AI Studio 提供免费 API 使用额度,但存在请求频率和使用限制,适合模型测试和轻量体验。
上下文缓存(Context Caching) $0.025/百万 Tokens 支持缓存读取,读取价格为 $0.025/百万 Tokens;缓存存储费用为 $1/百万 Tokens/小时,可降低重复输入成本。

Gemini 3.1 Flash Lite 主要功能

多模态输入与长上下文:支持处理文本、图像、音频、视频和PDF等多种输入格式。上下文窗口达100万token,可一次性处理整本长文档或大型数据集。 可调节的“思考等级”:提供minimal、low、medium、high四个可配置的推理深度等级。简单任务(如翻译)用低等级以节省成本和时间;复杂任务(如生成UI)调高等级以提升质量,灵活适配混合工作负载。 输出与集成能力:支持输出最长6.4万token的文本(含可执行代码),并支持结构化输出和工具调用,便于构建Agent应用。

总结

Gemini 3.1 Flash Lite主要面向成本敏感、追求大规模与低延迟的开发者和企业: 大批量任务开发者:以极低定价($0.25/百万输入token)处理翻译、内容审核、数据提取等高频重复任务,有效控制大规模部署成本。 实时应用构建者:首字响应快2.5倍、输出快45%,适用于实时翻译、移动端交互、数据仪表盘等低延迟场景。 Agent应用开发者:4档思考等级可灵活切换,简单任务用低等级降本,复杂任务(如UI生成)调高等级保质量,是多用途Agent的理想基础模型。 各类企业:电商、时尚等行业可用其低成本将AI集成至此前预算受限的业务环节,实现规模化落地。

评论(0)

发表评论

Advertisement 728 × 90

Google 模型对比

模型 上下文 定价 API 发布 全球热度
Gemini 3.1 Flash Lite
1M $0.250 / $1.500 per 1M YES 2026-05
77/100
1M $0.375 / $1.875 per 1M YES 2026-08
95/100
1M $1.500 / $7.500 per 1M YES 2026-07
96/100
1M $0.300 / $2.500 per 1M YES 2026-07
74/100
131K $0.500 / $3.000 per 1M YES 2026-06
80/100

类似模型

关联工具

相关新闻