ERNIE 5.1

4.60
ERNIE 5.1 发布后,我先看的不是参数,而是两个数字:Arena Search 全球第四,预训练成本只有同行的 6%。 这次百度没继续往“大”上卷,而是把模型规模和使用成本一起往下压。
Advertisement 728 × 90
公司Baidu
上下文128K
发布日期2026-05
更新日期2026-09-04

ERNIE 5.1 概述

ERNIE 5.1 是百度文心系列在 2026 年 5 月推出的旗舰级文本大模型,基于 ERNIE 5.0 的预训练底座,通过“多维弹性预训练”提取更紧凑的子网络结构。

我主要拿它试了推理、Agent、长文档分析和文案写作。它能做知识问答、数学和逻辑推理,也能自主拆任务、调用工具完成多步骤工作。写作方面覆盖文案生成、润色、扩写等常见需求。

上下文窗口为 128K,单次最大输出 16K tokens。ERNIE 5.1 已接入文心一言官网、百度 AI Studio 星河社区,开发者也可以通过百度智能云千帆平台调用 API。

ERNIE 5.1 定价

套餐价格说明
输入 ≤32K tokens 0.004 元/千 tokens 普通问答、Agent、小型文档处理等常见任务
输出 ≤32K tokens 0.018 元/千 tokens 按模型实际生成的 token 数量计费
输入 32K-128K tokens 0.006 元/千 tokens 适合长文档分析、较长上下文任务
输出 32K-128K tokens 0.022 元/千 tokens 长上下文档位下的输出价格

ERNIE 5.1 主要功能

1. Agent 能力

这是我用下来感受最明显的一块。

单轮聊天其实很难拉开模型差距,真正容易翻车的是多步骤任务。比如查资料、做计算、调用工具、整理结果,再输出成表格,步骤一多,很多模型就开始漏任务或者做到一半断掉。

ERNIE 5.1 跑这类任务时,流程接得更完整。前面查到的信息后面还能继续用,连续执行几个步骤也不容易散架。

在 τ³-bench 和 SpreadsheetBench-Verified 评测中,它超过了 DeepSeek-V4-Pro。这个成绩和我的使用感受能对上:如果拿它做 Agent,它已经不只是“会回答”,而是更接近“能把事情做完”。

2. 推理和数学能力

AIME26 数学竞赛基准中,在允许工具调用的条件下,ERNIE 5.1 拿到 99.6 分,仅次于 Gemini 3.1 Pro。

GPQA、MMLU-Pro 这类知识和推理测试里,它也已经接近头部闭源模型。

榜单不能代替真实业务,但至少能说明它遇到复杂计算、代码逻辑和连续推演时,不需要再用“国产模型里已经不错了”这种话替它找补。

3. 世界知识与创意写作

ERNIE 5.1 在 MMLU-Pro、GPQA 这类知识密集型测试中表现靠前,创意写作内部评测接近 Gemini 3.1 Pro。

我拿它试了文案、润色和扩写,最直观的变化不是辞藻更多,而是句子顺了。

上一代偶尔会有很重的模型腔:硬转折、套话、每段都先总结再展开。ERNIE 5.1 里这种情况少了。它还没到完全看不出模型痕迹的程度——毕竟这类问题也不是某一家模型独有——但生成之后需要大面积删改的次数确实少了。

128K 上下文处理一般长文档够用,真碰到特别大的资料库或者百万字级材料,还是得拆。

4. 相比 ERNIE 5.0 的进化

ERNIE 5.1 这次最有意思的地方,是模型反而缩了。

它的总参数压缩到 ERNIE 5.0 的三分之一,激活参数降到二分之一,预训练成本只有同行的 6%。

背后用的是 Once-For-All 弹性训练框架。训练时同时优化不同规模的子模型,再从中提取更合适的网络结构。

结果很直接:模型体量更小,部分能力反而比 ERNIE 5.0 更强。

对实际业务来说,这种升级比单纯堆参数更有用。尤其是 Agent 和自动化场景,一次用户请求背后可能连续调用模型很多次,单次成本差一点,规模上来以后就是另一笔账。

总结

ERNIE 5.1 的优势很清楚:Agent 能力扎实,推理进了第一梯队,中文写作也比上一代顺,再加上 API 单价低,对开发者、中小企业和批量调用业务都有吸引力。

它也不是万能的。128K 上下文碰到超长资料不够宽裕,单次最大输出只有 16K tokens,原生多模态也不是它的强项。经常处理 1M 级上下文、强依赖图片或视频理解的业务,没必要硬选它。

如果你的需求是 Agent、复杂推理、自动化工作流,或者对 API 成本敏感,ERNIE 5.1 值得拿真实任务跑一轮。

至于要不要换模型,最后看三个数字就够了:完成率、平均 token 消耗、单任务成本。

这三个数字,比单看榜单更实在。

评论(0)

发表评论

Advertisement 728 × 90

类似模型

Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
96
个人认为Qwen3.7 Plus是阿里开始把多模态 Agent 真正往“干活”这件事上推了。 它能看屏幕、操作界面、写代码,再自己检查结果。单项能力未必最强,但把这些事串起来之后,实用性反而更值得看。
Alibaba
Kimi K3
96
Moonshot AI 最新旗舰模型,具备超长上下文、多模态理解和智能 Agent 任务执行能力。
Moonshotai