1. Agent 能力
这是我用下来感受最明显的一块。
单轮聊天其实很难拉开模型差距,真正容易翻车的是多步骤任务。比如查资料、做计算、调用工具、整理结果,再输出成表格,步骤一多,很多模型就开始漏任务或者做到一半断掉。
ERNIE 5.1 跑这类任务时,流程接得更完整。前面查到的信息后面还能继续用,连续执行几个步骤也不容易散架。
在 τ³-bench 和 SpreadsheetBench-Verified 评测中,它超过了 DeepSeek-V4-Pro。这个成绩和我的使用感受能对上:如果拿它做 Agent,它已经不只是“会回答”,而是更接近“能把事情做完”。
2. 推理和数学能力
AIME26 数学竞赛基准中,在允许工具调用的条件下,ERNIE 5.1 拿到 99.6 分,仅次于 Gemini 3.1 Pro。
GPQA、MMLU-Pro 这类知识和推理测试里,它也已经接近头部闭源模型。
榜单不能代替真实业务,但至少能说明它遇到复杂计算、代码逻辑和连续推演时,不需要再用“国产模型里已经不错了”这种话替它找补。
3. 世界知识与创意写作
ERNIE 5.1 在 MMLU-Pro、GPQA 这类知识密集型测试中表现靠前,创意写作内部评测接近 Gemini 3.1 Pro。
我拿它试了文案、润色和扩写,最直观的变化不是辞藻更多,而是句子顺了。
上一代偶尔会有很重的模型腔:硬转折、套话、每段都先总结再展开。ERNIE 5.1 里这种情况少了。它还没到完全看不出模型痕迹的程度——毕竟这类问题也不是某一家模型独有——但生成之后需要大面积删改的次数确实少了。
128K 上下文处理一般长文档够用,真碰到特别大的资料库或者百万字级材料,还是得拆。
4. 相比 ERNIE 5.0 的进化
ERNIE 5.1 这次最有意思的地方,是模型反而缩了。
它的总参数压缩到 ERNIE 5.0 的三分之一,激活参数降到二分之一,预训练成本只有同行的 6%。
背后用的是 Once-For-All 弹性训练框架。训练时同时优化不同规模的子模型,再从中提取更合适的网络结构。
结果很直接:模型体量更小,部分能力反而比 ERNIE 5.0 更强。
对实际业务来说,这种升级比单纯堆参数更有用。尤其是 Agent 和自动化场景,一次用户请求背后可能连续调用模型很多次,单次成本差一点,规模上来以后就是另一笔账。
评论(0)