Sakana AI 在 9 月 11 日同时发布了 Fugu Ultra v2 和 Fugu Max。 两者使用的是同一套多模型编排架构,但优化方向不同。Ultra v2 更偏向追求输出质量,Fugu Max 则把重点放在降低调用成本。
Advertisement 728 × 90
公司Sakana
上下文1M
发布日期2026-09
更新日期2026-09-15

Fugu Max 概述

Fugu Max 不是新的基础模型。

它和 Fugu Ultra v2 使用同一套多模型编排系统,区别主要在调度策略。

用户通过 OpenAI 兼容 API 提交任务后,Max 会根据任务需求,从模型池中选择合适的模型完成不同步骤,再整合最终结果。

和 Ultra v2 相比,Max 不追求每次都选择能力最强的模型,而是在满足任务要求的前提下控制成本。

Sakana 表示,Fugu Max 的输出价格相比 Claude Sonnet 5、GPT-5.6 Terra 和 Kimi K3 低 40% 到 60%。这个比较基于公开价格计算,实际成本还会受到内部模型调用次数、上下文传递量等因素影响。

如果 Ultra v2 更像是在追求“把事情做到最好”,那么 Max 更关心的是“花更少的钱把事情做好”。

Fugu Max 定价

套餐价格说明
Standard $20 / 月 基础订阅,适合个人体验和轻度使用。
Pro $100 / 月 用量约为 Standard 的 10 倍,适合高频使用。
Max $200 / 月 用量约为 Standard 的 20 倍,偏向团队和重度用户。
API 按量计费 输入 $2 / 1M tokens;输出 $6 / 1M tokens;缓存输入 $0.25 / 1M tokens 按实际 token 消耗计费。
API 长上下文 超过 272K 后:输入 $10 / 1M tokens;输出 $45 / 1M tokens 长上下文进入更高计费区间。

Fugu Max 主要功能

1. 成本优先的模型路由

这是 Fugu Max 和 Ultra v2 最大的区别。

Ultra v2 更倾向选择能力更强的模型,而 Max 会优先寻找能够完成任务、同时成本更低的方案。

系统会根据任务需求筛选模型,再决定调用哪个。

例如批量整理资料、生成基础代码、处理结构化内容,这类任务通常不需要每一次都使用最高能力模型。

但如果任务涉及复杂架构设计、深度推理或者关键决策,成本优先的策略可能会影响最终质量。

我如果测试 Fugu Max,会先拿它跑一批低风险任务。

比如资料整理、简单代码处理、重复性分析。

这些任务即使结果不够理想,也容易人工检查。如果它能稳定完成,再考虑扩大使用范围。


2. 更大的模型池,加入 NVIDIA Nemotron 系列

Fugu Max 使用 Fugu 系列中较大的模型池。

Sakana 提到加入了 NVIDIA 的 Nemotron 系列,扩大了可调用模型范围。

模型数量增加,对调度系统来说意味着更多选择。

但用户看不到每次请求具体调用了哪个模型。

Sakana 没有开放完整路由记录,因此开发者无法直接确认:

  • 任务经过了哪些模型;
  • 为什么选择这个模型;
  • 每一步消耗了多少成本。

普通使用者可能不会关心这些信息。

但如果企业需要控制预算、分析成本或者优化流程,这种不可见性会成为一个限制。


3. OpenAI 兼容 API

Fugu Max 使用和 Ultra v2 相同的 OpenAI 兼容 API。

已经接入 Fugu 的用户,不需要重新搭建系统,只需要修改模型 ID:

fugu-max

即可切换。

这对想快速测试不同方案的开发者比较方便。

但内部路由仍然由 Fugu 控制。

如果你希望明确指定某一步必须使用哪个模型,或者要求每次调用成本完全可预测,自建工作流可能更适合。

总结

Fugu Max 的核心吸引力很明确:更低的 API 成本。

输出价格降到 $6 / 1M tokens 后,它和 Ultra v2 的定位差异非常明显。

如果任务需要多步骤处理,但没有必要追求最高级别推理,Max 会更有吸引力。

我会先把它放在批量任务里测试,比如资料整理、基础代码处理、重复分析。

如果它能减少人工时间,我会继续用。

但如果为了省 API 费用,最后需要花更多时间检查和修改结果,那我会直接换回更强的模型。

涉及核心架构设计、复杂推理,或者错误成本很高的任务,我不会优先选择 Max。

Fugu Max 不是为了取代 Ultra v2。

它解决的是另一个问题:

不是“怎么让 AI 做得更强”,而是“怎么让多模型系统用更低成本运行”。

评论(0)

发表评论

Advertisement 728 × 90

Sakana 模型对比

模型 上下文 定价 API 发布 全球热度
Fugu Max
1M $2.000 / $6.000 per 1M YES 2026-09
1M $5.000 / $30.000 per 1M YES 2026-09
262K $0.950 / $4.000 per 1M YES 2026-08
33/100
1M $5.000 / $30.000 per 1M YES 2026-06
39/100

类似模型

Fugu Ultra
27
Fugu Ultra 挺特别。它自己不负责答题,而是把 GPT、Claude、Gemini 叫过来干活,再负责分工和收答案。 所以看它的跑分时,我不会把它当成一个普通大模型。叫它“AI 包工头”,反而更准确。
Sakana
Sakana Namazu
15
我对 Namazu 最感兴趣的地方,不是“Sakana 又出了一个日本模型”,而是它到底改了什么。 底层直接用 Kimi K2.6,Sakana 没重新造基座,主要精力放在日语后训练、工具调用和 API 产品化上。做完这一层,token 价格也没往上抬,还是 Kimi K2.6 原来的水平。
Sakana
Fugu Ultra v2
Sakana AI 在 9 月 11 日发布了 Fugu Ultra v2。我最关注的不是它的跑分,而是模型调度这件事。Ultra v2 没有把能力押在某个旗舰模型上,而是把任务拆开,再交给不同模型处理。
Sakana
Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba