Mercury 2.5 是 Inception 2026 年 9 月 8 日发布的扩散式大语言模型,dLLM。它不走传统自回归那条逐 token 生成的路:先形成一版整体输出,再多轮去噪、修正,多个位置可以同时处理。
模型支持文本输入输出、工具调用、结构化 JSON、可调推理等级,上下文窗口 26 万 token,单次最大输出 6.6 万 token。适合搜索系统、语音交互、Agent 流程,以及其他需要频繁调模型、对响应时间敏感的产品。
Mercury 2.5 是 Inception 2026 年 9 月 8 日发布的扩散式大语言模型,dLLM。它不走传统自回归那条逐 token 生成的路:先形成一版整体输出,再多轮去噪、修正,多个位置可以同时处理。
模型支持文本输入输出、工具调用、结构化 JSON、可调推理等级,上下文窗口 26 万 token,单次最大输出 6.6 万 token。适合搜索系统、语音交互、Agent 流程,以及其他需要频繁调模型、对响应时间敏感的产品。
| 套餐 | 价格 | 说明 |
|---|---|---|
| API 输入 | 标准 $0.20/百万 token;发布期 $0.04 | 按输入计费 |
| API 输出 | 标准 $0.75/百万 token;发布期 $0.15 | 按生成计费 |
| 缓存输入 | $0.02/百万 token | 重复上下文降低输入成本 |
| 新用户额度 | 1 亿免费 token | Inception 提供 |
| Vercel AI Gateway | 免费用户每月 $5 额度 | 可经该网关调用 |
新用户有 1 亿 token 免费额度,测试够用。正式使用按量付费,输入 $0.20/百万、输出 $0.75/百万,放在高频短调用场景里成本友好。偶尔聊天、写长文的个人用户没必要专门接 API,也没有包月可选。
Mercury 2.5 的核心是扩散式生成。自回归模型要等前一个 token 出来才能生成下一个,它可以同时修改输出中的多个位置,少了严格串行等待。Inception 公布 1107 token/秒,首 token 延迟低于 300 毫秒。
OpenCall 的案例更直观:接入后,P99 从数分钟降到约 1 秒,P50 从 0.4 秒降到 0.2 秒以内。一次请求只跑一轮,差别未必夸张;Agent 连续调用十几次、几十次,等待会一层层叠上去。
支持并行工具调用,也能按 schema 返回 JSON。做搜索 Agent 时,可以同时发起多个查询,再把结果按固定结构交给下一步程序。推理等级可调,简单任务用低档减少等待,复杂任务再提高档位。没有太多花活,都是开发者实际会用的接口能力。
Mercury 2 的上下文窗口是 12.8 万 token,2.5 提到 26 万,最大输出 6.6 万 token。长文档、搜索结果集合、一部分规模不小的代码,基本放得下。摘要、资料整合够用。窗口大只解决容量,能不能一直抓住关键内容,还得看具体任务。
Mercury 2 在 2026 年 2 月发布,官方速度约 1009 token/秒。2.5 把速度提到 1107,上下文从 12.8 万扩大到 26 万,官方称智能水平提升约 40%,编码、指令遵循、数学推理有所增强。速度提升幅度不算大,上下文翻倍更明显。
编程要单独看。第三方测试跑了 40 次编程任务,28 次完全通过。另有 11 次任务实际失败,模型仍判断为完成。代码写错还能被测试拦住;任务状态判断错了,后面的自动化流程可能直接往下一步走。
Mercury 2.5 的快和便宜是实打实的,拿它跑搜索、语音、Agent 里的高频小任务很合适,调用次数越多越划算。但第三方测试里那 11 次“没做成却说做完了”说明它在复杂编程上还靠不住。想让它独立改完整个项目,我不会只看速度就放手。
| 模型 | 上下文 | 定价 | API | 发布 | 全球热度 |
|---|---|---|---|---|---|
|
Mercury 2.5
|
260K | $0.040 / $0.150 per 1M | YES | 2026-09 | — |
| 260K | $0.040 / $0.150 per 1M | YES | 2026-08 |
58/100
|
评论(0)