Mercury 2.5 Preview

Inception Labs 放出了 Mercury 2.5 Preview。 它不是 GPT、Claude 那种逐 Token 生成的自回归模型,而是扩散式大语言模型。 最抓眼球的是速度:官方给出的数字是 1107 Token/秒。 但先别急着兴奋。这个成绩还没有第三方验证,模型也没开源,只能走 AP
Advertisement 728 × 90
公司Inception
上下文260K
发布日期2026-08
更新日期2026-09-03

Mercury 2.5 Preview 概述

Mercury 2.5 Preview 是 Inception 在 2026 年 8 月 31 日发布的扩散式大语言模型,也就是 dLLM。现在还是 Preview 阶段,可以通过 OpenRouter 等平台调用。

它和主流大模型最大的差别,在生成方式。

传统自回归模型是一段一段往后生成,后一个 Token 要等前一个算完。Mercury 2.5 走的是并行路线:先生成一个粗略结果,再经过多轮去噪,把文本逐步修正。

这套机制的目标很直接:把生成速度提上去。

模型支持 256K~260K 上下文,最大输出约 65K Token,还有可调推理级别、并行工具调用和结构化 JSON 输出。

输入输出都是纯文本,不支持图片、视频或音频。

Inception 给它的定位也不是最顶级旗舰,而是对标 GPT-5.6 Luna 低推理档、Gemini 3.5 Flash-Lite 和 Claude Haiku 4.5 这一档。

一句话:不追求最强,先把“够用、便宜、快”做到极致。

现在的问题也很明确。

模型权重没开放,第三方跑分也没有。 BenchLM 这类平台暂时还看不到它的公开成绩,所以官方数据只能先当参考。

Mercury 2.5 Preview 定价

套餐价格说明
输入 Token 标价 0.20 美元 / 百万 Token;首发价 0.04 美元 80% 折扣,截至 2026 年 9 月 8 日
输出 Token 标价 0.75 美元 / 百万 Token;首发价 0.15 美元 80% 折扣,截至 2026 年 9 月 8 日
缓存读取 0.02 美元 / 百万 Token 官方标价

折扣期的价格确实低。

输入 0.04 美元、输出 0.15 美元 / 百万 Token,已经压到很便宜的档位。

但有两点别忽略。

第一,9 月 8 日之后会恢复标价

第二,它是闭源 API。你不能自己把模型拉回来部署,长期成本最终还是看 Inception 怎么定价。

Mercury 2.5 Preview 主要功能

1. 扩散架构:它不是一个字一个字往外吐

Mercury 2.5 最特别的地方,就是生成方式。

普通大模型更像打字员,一个 Token 接一个 Token 往外敲。

Mercury 2.5 更像先铺一版草稿,再一轮轮改,最后同时把一批 Token 修到位。

Inception 宣称,这套架构让它在标准 GPU 上能跑到 1107 Token/秒

这个数字如果真能稳定复现,确实很夸张。

尤其是长文本、Agent 多轮调用、语音交互这种对延迟很敏感的任务,速度差一点,体感就会差很多。

但这里必须再提醒一句:

1107 Token/秒还是官方数据。

没第三方复现之前,先别把它当行业新标准。

2. 推理强度可以调

Mercury 2.5 支持不同推理级别。

简单任务可以把推理开低一点,少花 Token,也更快。

复杂代码、长逻辑问题,再把推理强度拉高。

这个设计不新鲜,但放在一个主打速度的模型上很合理。

毕竟如果每个问题都开最高推理,再快的生成也会被前面的思考时间拖住。

3. 并行工具调用,对 Agent 比较友好

Mercury 2.5 支持并行工具调用,还能按 Schema 直接输出 JSON。

这个组合对开发者比较实用。

比如一个 Agent 同时要查两个 API、读一个数据库,如果可以并行调用,就不用等第一个结束再跑第二个。

再配合高生成速度,整条工作流的延迟可能会压得更低。

JSON 输出也省事。

模型直接按预设格式吐结果,后面少写一层清洗代码。

4. 上下文够大,输出也够长

Mercury 2.5 的上下文窗口标注有两个版本:256K 或 260K Token

最大输出约 65K Token

拿来读长文档、大型代码库,或者挂很长的 Agent 轨迹,空间都够。

这个规格不算市场上最大,但放在它这个“高速、低价”的定位里已经够用了。

总结

优势

  • 扩散架构做文本生成,思路和主流自回归模型不同
  • 官方宣称速度达到 1107 Token/秒
  • 首发价格很低,输入 0.04 美元、输出 0.15 美元 / 百万 Token
  • 支持并行工具调用
  • 支持结构化 JSON 输出
  • 256K~260K 上下文
  • 最大输出约 65K Token
  • 适合对延迟敏感的 Agent 和交互场景

限制

  • 速度和性能数据都来自官方,缺少第三方验证
  • 闭源,只能通过 API 使用
  • 不能自托管
  • 只支持文本,不是多模态模型
  • 80% 首发折扣会在 2026 年 9 月 8 日结束
  • 官方对标的是“便宜够用”档,不是最顶级旗舰

推荐人群

  • 做语音、搜索 Agent、代码 Agent 等低延迟应用的开发者
  • 想低成本测试扩散式 LLM 的研究人员
  • 对生成速度比极限推理能力更敏感的项目
  • 想趁首发折扣做 PoC 的团队

不推荐人群

  • 必须拿到模型权重、自行部署的团队
  • 对数据隐私要求很高的企业
  • 需要图片、视频或音频输入的项目
  • 现在就要拿它做关键生产决策,又不想等第三方验证的人

评论(0)

发表评论

Advertisement 728 × 90

类似模型