GLM-5.3是智谱(海外品牌Z.ai)推出的新一代大语言模型。
它和GLM-5.2沿用同一套基座,采用总参数约7430亿的MoE架构,主要通过扩大后训练(Post-training)Scaling来提升能力,也就是让模型在更复杂、更长程的任务环境中接受大规模强化学习训练。
它的重点很明确:代码生成、复杂工程任务和长时间连续执行。
模型以文本能力为主,支持100万Token上下文窗口,可以一次读入规模较大的代码项目,适合跨文件分析、代码修改和长任务处理。
GLM-5.3是智谱(海外品牌Z.ai)推出的新一代大语言模型。
它和GLM-5.2沿用同一套基座,采用总参数约7430亿的MoE架构,主要通过扩大后训练(Post-training)Scaling来提升能力,也就是让模型在更复杂、更长程的任务环境中接受大规模强化学习训练。
它的重点很明确:代码生成、复杂工程任务和长时间连续执行。
模型以文本能力为主,支持100万Token上下文窗口,可以一次读入规模较大的代码项目,适合跨文件分析、代码修改和长任务处理。
| 套餐 | 价格 | 说明 |
|---|---|---|
| Lite | $12.6 / $18 每月 | 10,000积分 / 周,适合轻量开发和小规模项目 |
| Pro | $56 / $80 每月 | 约6倍Lite配额,适合日常开发和中等规模项目 |
| Max | $117.6 / $168 每月 | 约14倍Lite配额,适合高强度使用和大型项目 |
工作日14:00—18:00(UTC+8)高峰时段之外,调用只消耗一半积分。通过ZCode调用时,上下文缓存命中率可达到98%+,长代码任务的实际消耗还能进一步压低。
智谱内部编程体感评测中,GLM-5.3相比5.2提升约50%。
Terminal-Bench 3.0上,成绩从4.6升到28.3,高于Kimi K3的17.4。
DeepSWE测试中,分数也从46.2涨到66.9,距离Claude Fable 5的69.7已经不远。
这些测试并不只是让模型单轮生成一段代码,还会涉及终端操作、项目理解、跨文件修改和持续执行。5.3这次的提升,主要集中在这些更接近真实开发的任务上。
代码模型不只要看任务能不能做对,跑一次要消耗多少Token也很重要。
在High思考档位下,5.3平均使用约5万tokens完成任务,准确率31.4%;Claude Opus 4.8平均约12万tokens,准确率29.5%。
放到Agent场景里,这个差距会更明显。一项任务往往需要连续调用很多轮,还会反复读取代码和修改文件,Token消耗很容易累积。
对重度使用者来说,最后反映出来的就是调用成本。
CyberGym漏洞推理评测中,5.3拿到84.5%,超过Anthropic Mythos 5的83.8%。
安全团队还用它测试了269个项目,共发现2436个真实漏洞,其中包括一个潜伏40多年的DNS协议级高危漏洞。
这类能力也提高了权重开放的安全门槛。智谱因此把开源时间推迟两周,用于增加安全防护。
5.3没有扩大模型规模,变化主要发生在训练阶段。
智谱把更多强化学习资源投入终端操作、复杂代码项目和长程任务,让模型在更接近真实工程的环境里反复训练。
和5.2相比,提升并不只体现在单轮代码生成,持续执行、跨文件理解和复杂工程处理都更明显。
这也是5.3和上一代最核心的区别:不是换了一套更大的底子,而是把同一套底子的后训练做得更深。
编程能力强,尤其适合长程工程任务;Token消耗控制得不错,对Agent场景更友好;安全推理和漏洞发现能力也比较突出。
它是纯文本模型,不能直接处理图片、视频等多模态内容。思考模式无法彻底关闭,只能降低强度,简单任务可能产生额外Token消耗。API开放范围也比较有限,主要入口还是订阅制Coding Plan。
经常用AI写代码、分析大型项目、做重构、跑Agent任务或研究安全问题的开发者和团队。
主要需求是普通聊天、简单问答,或者工作里大量涉及图片和视频的用户。
| 模型 | 上下文 | 定价 | API | 发布 | 全球热度 |
|---|---|---|---|---|---|
![]()
GLM-5.3
|
1M | — | YES | 2026-08 |
68/100
|
| 1M | 付费 | YES | 2026-06 |
65/100
|
评论(0)