GLM 5.3 Flash

过去几天,AI 开发者社区一直在聊一个叫 Ox Alpha 的匿名模型。不知道谁做的,没有发布会,也没有技术报告。它就这么上线了 OpenRouter。8 月 26 日,谜底揭晓。智谱正式认领:Ox Alpha 就是 GLM-5.3-Flash。一个 3200 亿总参数、18 亿激活参数的原生多模态
Advertisement 728 × 90
公司Z Ai
上下文1.3M
发布日期2026-08
更新日期2026-08-31

GLM 5.3 Flash 概述

GLM-5.3-Flash 是 GLM-5 系列首个原生多模态模型,8 月 26 日正式上线并开源。

总参数 320B,激活参数 18B。模型看着很大,推理时真正参与计算的只有一部分参数,这也是它能把成本压下来的关键之一。

它的方向很明确:编程、Agent、生产环境。

支持文本、图片、视频输入,输出文本。上下文长度 104 万 Token,大型代码仓库、项目文档和历史对话可以一次塞进去不少。

API 模型 ID 是 glm-5.3-flash。权重也已经开源,Hugging Face 可以下载,只是文件超过 300GB,本地部署并不轻松。

GLM 5.3 Flash 定价

套餐价格说明
API 按量计费 输入 0.15 美元 / 百万 Token,输出 0.50 美元 / 百万 Token 标价约为 GLM-5.3 的 1/10,限时折扣后约 1/20
GLM Coding Plan 个人版 18 美元/月起 Flash 额度是 GLM-5.3 的 3 倍;非高峰时段和周末全天积分半价
本地部署 模型免费 权重超过 300GB,FP8 约 306GiB,需要自行准备算力

智谱给出的对比里,GLM-5.3-Flash 在 AA 综合智能指数拿到 57 分,和 Claude Opus 4.8 持平;折扣后单任务成本只有后者的约 1/40。

价格确实压得很低。

想自己部署,可以直接下权重,不收模型费。

问题也很现实:300GB 级别的文件,不是普通电脑能轻松接住的。

开发者和团队更适合 Coding Plan,额度更高,非高峰时段还能省一半积分。

只是偶尔调用的话,按量付费反而省事,用多少算多少。

GLM 5.3 Flash 主要功能

1. 104 万 Token,上下文是真的长

这个长度对普通聊天没多大意义,对代码项目却很有用。

代码仓库、文档、历史对话、任务记录,可以一次放进去很多。Agent 连续跑几十步时,也不用频繁把背景重新解释一遍。

做大型项目时,这种差距会很明显。

2. 它会“看”,而且视觉能力直接参与编码

GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型。

UI 截图、设计稿、渲染画面、视频,都能直接给它看。

前端、游戏、3D 场景这类任务里,模型可以自己检查视觉结果,再继续改代码,不只是“识图以后回答一句”。

官方还展示过一个挺有意思的案例:没有外部素材,模型自主运行 16 个小时,搭出了一套约 400 平方米的专业厨房设计。

它也能直接操作软件界面。

没有 API 时,就看 UI、点按钮、填内容、测试,再继续改。

这个方向比单纯刷几个视觉 benchmark 更有意思。

3. Agent 能力是它真正的重点

Function Calling、JSON 输出这些都支持。

外部 API、软件工具、结构化数据,都能接进来。

官方展示的工作流已经不只是“帮你写一段代码”,而是从研究、分析,一直做到 PPTX、PDF、DOCX、XLSX 成品交付。

它更像一个执行模块,不只是聊天框里的模型。

4. 编程表现已经摸到 Claude Opus 4.8 附近

这是 GLM-5.3-Flash 最抓眼球的地方。

DeepSWE v1.1 上,它拿到 63.4,GLM-5.2 是 46.2。

在 Z.ai Code Bench 的全力模式里,GLM-5.3-Flash 是 29.0,Claude Opus 4.8 是 29.5。

差得很小。

AutomationBench 更夸张:48.8 对 26.2。

真正有意思的还不是分数,而是它比 GLM-5.2 小了一圈。

GLM-5.2 总参数 640B,GLM-5.3-Flash 只有 320B;激活参数也从 32B 降到 18B,层数从 92 层砍到 45 层,再配上稀疏注意力和线性注意力的混合架构。

模型更轻,表现反而更强,价格还更低。

这才是 Flash 这一代最值得看的地方。

总结

优势

  • 价格低:API 成本压得很狠,Coding Plan 个人版 18 美元/月起。
  • 编程能力强:DeepSWE 63.4,Code Bench 已经接近 Claude Opus 4.8。
  • 上下文够长:104 万 Token,对大型代码库和长时间 Agent 很友好。
  • 开源:权重可以直接下载。
  • 国产算力实测过:匿名阶段的大规模真实流量跑在 10 万张国产芯片上,不是实验室里的演示数据。

限制

最大的门槛还是本地部署。

300GB+ 权重摆在那里,普通消费级设备基本不用想。

还有思考模式。

thinking.type 只能设成 enabled,不能关闭。对追求极低延迟的场景,这不算友好。

至于匿名测试这件事,反倒挺有意思。

身份没公开时,大家已经先用了一轮,评价和流量都是真实发生的。后来官方认领,社区对它的第一印象已经形成了。

这种“先用,再知道是谁做的”的发布方式,确实少见。

推荐人群 / 不推荐人群

如果你主要做编程、Agent、大型代码仓库或者自动化工作流,GLM-5.3-Flash 很值得试。

尤其适合对成本敏感,又想用上第一梯队编程模型能力的开发者。

本地部署就别太考虑,300GB 权重是硬门槛。

如果你更在意极低延迟、必须关闭思考模式,或者平时主要拿 AI 写邮件、做轻办公,它就没那么合适。

评论(0)

发表评论

Advertisement 728 × 90

Z Ai 模型对比

模型 上下文 定价 API 发布 全球热度
GLM 5.3 Flash
1.3M $0.075 / $0.250 per 1M YES 2026-08
1M $1.400 / $4.400 per 1M YES 2026-08
68/100
1M 付费 YES 2026-06
65/100

类似模型

GLM 5.3
94
6月发布GLM-5.2后,智谱在8月14日又推出了GLM-5.3。这次更新最有意思的地方,不是模型继续变大,而是基座和参数规模都没变,提升主要来自后训练。相比单纯堆参数,我更关注这种路线到底还能把模型往上推多少,尤其是在代码和长任务上。
Z Ai
GLM 5.2
92
Z.ai 出品的大规模推理模型,百万上下文,擅长编码与复杂自动化,支持高强度推理,单任务完成全流程开发。
Z Ai
Doubao Pro
100
字节跳动旗舰模型,支持日中英三语,提供企业级 API。
ByteDance
DeepSeek R2
99
开源推理专用模型,MATH 基准测试成绩与 GPT-4o 相当,MIT 协议开源。
DeepSeek
Qwen3-235B
99
阿里巴巴 MoE 模型,以 220 亿激活参数实现高质量低成本推理。
Alibaba
DeepSeek V4 Pro 0813
99
个人觉得DeepSeek V4 Pro 0813 更适合拿来干活。聊天、润色几句话当然也能做,但我会觉得有点浪费。真正让我觉得它有价值的,还是读项目、改代码、追 Bug,特别是碰到一堆互相牵连的任务时。
DeepSeek
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba