1. 104 万 Token,上下文是真的长
这个长度对普通聊天没多大意义,对代码项目却很有用。
代码仓库、文档、历史对话、任务记录,可以一次放进去很多。Agent 连续跑几十步时,也不用频繁把背景重新解释一遍。
做大型项目时,这种差距会很明显。
2. 它会“看”,而且视觉能力直接参与编码
GLM-5.3-Flash 是 GLM-5 系列第一个原生多模态模型。
UI 截图、设计稿、渲染画面、视频,都能直接给它看。
前端、游戏、3D 场景这类任务里,模型可以自己检查视觉结果,再继续改代码,不只是“识图以后回答一句”。
官方还展示过一个挺有意思的案例:没有外部素材,模型自主运行 16 个小时,搭出了一套约 400 平方米的专业厨房设计。
它也能直接操作软件界面。
没有 API 时,就看 UI、点按钮、填内容、测试,再继续改。
这个方向比单纯刷几个视觉 benchmark 更有意思。
3. Agent 能力是它真正的重点
Function Calling、JSON 输出这些都支持。
外部 API、软件工具、结构化数据,都能接进来。
官方展示的工作流已经不只是“帮你写一段代码”,而是从研究、分析,一直做到 PPTX、PDF、DOCX、XLSX 成品交付。
它更像一个执行模块,不只是聊天框里的模型。
4. 编程表现已经摸到 Claude Opus 4.8 附近
这是 GLM-5.3-Flash 最抓眼球的地方。
DeepSWE v1.1 上,它拿到 63.4,GLM-5.2 是 46.2。
在 Z.ai Code Bench 的全力模式里,GLM-5.3-Flash 是 29.0,Claude Opus 4.8 是 29.5。
差得很小。
AutomationBench 更夸张:48.8 对 26.2。
真正有意思的还不是分数,而是它比 GLM-5.2 小了一圈。
GLM-5.2 总参数 640B,GLM-5.3-Flash 只有 320B;激活参数也从 32B 降到 18B,层数从 92 层砍到 45 层,再配上稀疏注意力和线性注意力的混合架构。
模型更轻,表现反而更强,价格还更低。
这才是 Flash 这一代最值得看的地方。
评论(0)