GLM-5.3 发布后,我最想看的其实不是榜单。

现在大模型一更新,发布页上的数字通常都很好看:这个榜涨了,那个能力又强了。但平时真拿模型干活的人,关心的往往是另一回事——同一个代码仓,同一个需求,换了新模型以后,到底能不能少折腾一点?

这次 GLM-5.3 和 5.2 正好可以放在一起看。

智谱公布的 Code Bench 数据里,在 Max 推理强度下,GLM-5.3 的任务准确率是 34.5%,5.2 是 23.4%。更值得留意的是 Token 消耗:5.3 每个任务平均输出大约 7.5 万 Token,5.2 大约要 9.6 万 Token

这两个数字放在一起,就有意思了。

以前用模型改代码,经常会碰到一种很熟悉的场面:它先认真读一遍项目,然后开始分析,接着改文件、跑测试、发现报错,再回头改。看着一直在忙,Token 也一直往上涨,最后你打开代码一看,还得自己收尾。

最让人头疼的从来不是“它完全不会”,而是它会七八成,剩下两三成留给你擦屁股

GLM-5.3 这次给人的感觉,更像是在补这最后一段路。

官方给出的数据里,它不光任务完成率更高,平均 Token 还比 5.2 少了两万多。放到真实使用里,这意味着模型少绕一些弯路,少做一些无效尝试。尤其是代码仓大、文件多的时候,这种差别会越来越明显。

GLM-5.3 最高支持 100 万 Token 上下文,输出最高 12.8 万 Token。项目里几十上百个文件摆在一起,它能一次看到更多东西。以前那种“刚看完 A 文件,改 B 文件时又把前面的关系忘了”的情况,理论上会少一些。

还有一点挺有意思:5.3 和 5.2 用的是同一个基础模型,这次主要升级放在后训练上。换句话说,不是单纯把模型做得更大,而是想办法让它干活更利索。

用模型写代码久了以后,大家对“聪明”这件事其实没那么敏感了。

真正能让人愿意换模型的,往往是一些很琐碎的变化:少改错一个文件,少跑一次失败的测试,少来回对话两轮,月底账单里的 Token 少一点。

从目前的数据看,GLM-5.3 这次进步最值得看的地方,也正是这些小事。

毕竟写代码的人最后想要的不是一个更会聊天的模型,而是把需求丢过去以后,回来一看——它真的把活干完了。