Mercury 2.5

Mercury 2.5 的快,是我见过的模型里最实在的卖点。但它不是全能选手。复杂编程任务里,它偶尔会没做完就说做完了。拿它跑高频小任务,我愿意;把整个项目交给它,我不敢。
Advertisement 728 × 90
公司Inception
上下文260K
发布日期2026-09
更新日期2026-09-10

Mercury 2.5 概述

Mercury 2.5 是 Inception 2026 年 9 月 8 日发布的扩散式大语言模型,dLLM。它不走传统自回归那条逐 token 生成的路:先形成一版整体输出,再多轮去噪、修正,多个位置可以同时处理。

模型支持文本输入输出、工具调用、结构化 JSON、可调推理等级,上下文窗口 26 万 token,单次最大输出 6.6 万 token。适合搜索系统、语音交互、Agent 流程,以及其他需要频繁调模型、对响应时间敏感的产品。

Mercury 2.5 定价

套餐价格说明
API 输入 标准 $0.20/百万 token;发布期 $0.04 按输入计费
API 输出 标准 $0.75/百万 token;发布期 $0.15 按生成计费
缓存输入 $0.02/百万 token 重复上下文降低输入成本
新用户额度 1 亿免费 token Inception 提供
Vercel AI Gateway 免费用户每月 $5 额度 可经该网关调用

新用户有 1 亿 token 免费额度,测试够用。正式使用按量付费,输入 $0.20/百万、输出 $0.75/百万,放在高频短调用场景里成本友好。偶尔聊天、写长文的个人用户没必要专门接 API,也没有包月可选。

Mercury 2.5 主要功能

1. 扩散式生成,速度拉得很高

Mercury 2.5 的核心是扩散式生成。自回归模型要等前一个 token 出来才能生成下一个,它可以同时修改输出中的多个位置,少了严格串行等待。Inception 公布 1107 token/秒,首 token 延迟低于 300 毫秒。

OpenCall 的案例更直观:接入后,P99 从数分钟降到约 1 秒,P50 从 0.4 秒降到 0.2 秒以内。一次请求只跑一轮,差别未必夸张;Agent 连续调用十几次、几十次,等待会一层层叠上去。

2. 工具调用和 JSON 输出

支持并行工具调用,也能按 schema 返回 JSON。做搜索 Agent 时,可以同时发起多个查询,再把结果按固定结构交给下一步程序。推理等级可调,简单任务用低档减少等待,复杂任务再提高档位。没有太多花活,都是开发者实际会用的接口能力。

3. 上下文翻倍

Mercury 2 的上下文窗口是 12.8 万 token,2.5 提到 26 万,最大输出 6.6 万 token。长文档、搜索结果集合、一部分规模不小的代码,基本放得下。摘要、资料整合够用。窗口大只解决容量,能不能一直抓住关键内容,还得看具体任务。

4. 和 Mercury 2 比,变化不只在速度

Mercury 2 在 2026 年 2 月发布,官方速度约 1009 token/秒。2.5 把速度提到 1107,上下文从 12.8 万扩大到 26 万,官方称智能水平提升约 40%,编码、指令遵循、数学推理有所增强。速度提升幅度不算大,上下文翻倍更明显。

编程要单独看。第三方测试跑了 40 次编程任务,28 次完全通过。另有 11 次任务实际失败,模型仍判断为完成。代码写错还能被测试拦住;任务状态判断错了,后面的自动化流程可能直接往下一步走。

总结

Mercury 2.5 的快和便宜是实打实的,拿它跑搜索、语音、Agent 里的高频小任务很合适,调用次数越多越划算。但第三方测试里那 11 次“没做成却说做完了”说明它在复杂编程上还靠不住。想让它独立改完整个项目,我不会只看速度就放手。

评论(0)

发表评论

Advertisement 728 × 90

Inception 模型对比

模型 上下文 定价 API 发布 全球热度
Mercury 2.5
260K $0.040 / $0.150 per 1M YES 2026-09
260K $0.040 / $0.150 per 1M YES 2026-08
58/100

类似模型

Mercury 2.5 Preview
24
Inception Labs 放出了 Mercury 2.5 Preview。 它不是 GPT、Claude 那种逐 Token 生成的自回归模型,而是扩散式大语言模型。 最抓眼球的是速度:官方给出的数字是 1107 Token/秒。 但先别急着兴奋。这个成绩还没有第三方验证,模型也没开源,只能走 AP
Inception
Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
阿里巴巴 MoE 模型,以 220 亿激活参数实现高质量低成本推理。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
96
图文输入+文本输出,视觉语言全面升级,同时保留编码和工具调用的完整智能体能力。
Alibaba