Fugu Ultra v2

Sakana AI 在 9 月 11 日发布了 Fugu Ultra v2。我最关注的不是它的跑分,而是模型调度这件事。Ultra v2 没有把能力押在某个旗舰模型上,而是把任务拆开,再交给不同模型处理。
Advertisement 728 × 90
公司Sakana
上下文1M
发布日期2026-09
更新日期2026-09-15

Fugu Ultra v2 概述

Fugu Ultra v2 不是单独的大语言模型,而是一套多模型编排系统。

用户通过 OpenAI 兼容 API 提交任务,后台调度器会拆分任务、选择模型,再把不同步骤的结果合并起来。

它主要面向复杂多步推理、自主研究和全栈软件开发,也支持图像输入、联网搜索,以及最高 100 万 token 的上下文窗口。

拿软件开发举例,一个任务可能同时涉及代码阅读、依赖分析、架构设计、代码生成和调试。自己搭多模型工作流,需要手动安排这些步骤;Fugu 把模型选择和调度放到了后台。

Sakana 公布的 Chartography 测试里,Fugu Ultra v2 得分 48.3,Fable 5 为 29.5,Claude Opus 5 为 27.3。这组成绩很突出,但数据主要来自官方评测,真实项目里的稳定性、延迟和成本还要单独看。

Fugu Ultra v2 定价

套餐价格说明
Standard $20 / 月 基础订阅,适合个人体验和轻度使用。
Pro $100 / 月 用量约为 Standard 的 10 倍,适合使用频率较高的人。
Max $200 / 月 用量约为 Standard 的 20 倍,偏向重度用户和团队。
API 按量计费 输入 $5 / 1M tokens;输出 $30 / 1M tokens;缓存输入 $0.50 / 1M tokens 按实际 token 消耗计费,适合开发接入和自动化任务。
API 长上下文 超过 272K 后:输入 $10 / 1M tokens;输出 $45 / 1M tokens 上下文超过 272K 后进入更高计费区间。

Vercel AI Gateway 还提供每 30 天 $5 的体验额度。第一次测试可以先从体验额度或 Standard 开始。

Pro 比 Standard 贵 5 倍,用量约多 10 倍,高频使用时更划算。Max 更适合团队或长期重度调用。

API 成本不能只看最终输出。Fugu 会在后台进行多轮模型调用和上下文传递,复杂任务的实际 token 消耗可能比最终生成内容高得多。

Fugu Ultra v2 主要功能

1. 多模型自动编排

Ultra v2 的核心是模型调度。

收到任务后,系统会判断要不要拆分、每一步交给哪个模型,以及中间结果怎么继续传下去。用户不用自己维护模型 Router,也不用手动安排一整套 Agent 流程。

这个设计更适合研究、代码分析、开发这类需要连续推进的任务。翻译、短文本总结、小段代码之类的工作,本身一步就能完成,多一层编排未必有必要,反而可能增加等待时间和费用。

2. 100 万 Token 上下文、图像输入和联网搜索

Ultra v2 支持最高 100 万 token 上下文,可以处理大型代码库、长文档、论文和成批研究资料,也能接收图像并调用联网搜索。

100 万 token 更像一个上限,不适合当成常规用法。超过 272K 后价格会提高,而且把资料全部塞进上下文,也不一定比先筛选再分析更有效。

如果任务只涉及其中几份文件,先检索相关内容,再交给模型处理,通常更省成本。

3. OpenAI 兼容 API

Fugu Ultra v2 使用 OpenAI 兼容 API。

已经按照 OpenAI API 形式开发的项目,接入时不用重写整套调用层。开发者提交任务后,后台的模型选择和调度交给 Fugu 处理。

好处是少维护一层多模型路由,代价则是控制权会减少。团队如果需要精确指定每一步使用哪个模型,或者严格记录每次调用成本,自己搭工作流可能更合适。

4. 相比上一代,模型池调整更明显

Ultra v2 相比 v1,一个重要变化是模型池。

新版移除了 Fable 5、Fable 5.1 和 GPT-6 Astra,训练截止时间更新到 2026 年 8 月 28 日。

这个改动降低了系统对少数旗舰模型的依赖。某个模型涨价、接口调整或者表现变化时,调度系统可以替换底层模型,而不必跟着重做整套产品。

从 v1 迁移到 v2 也比较直接。SDK 不需要更换,只需要把模型 ID 改成:

fugu-ultra-v2.0

总结

Fugu Ultra v2 的优势在于把任务拆解和模型选择交给系统处理。研究、大型代码库分析、长资料整理这类任务,本来就需要多个步骤,自动调度能减少自己搭工作流的成本。

它的限制也很实际:多模型调用会增加 token 消耗,长上下文价格更高,后台调度又减少了一部分可控性。官方 Benchmark 成绩不错,但单看分数还不足以判断它在真实工作流里的表现。

如果你经常做研究、代码分析、Agent 工作流,或者希望减少对单一模型供应商的依赖,Fugu Ultra v2 值得测试。

如果主要需求是日常问答、翻译、普通写作和简单代码,直接使用成熟的单模型更省事。对成本特别敏感,或者希望精确控制每一步模型调用的人,也未必适合它。

我自己会优先拿它测试代码库分析和长资料研究。日常问答和简单写作,没有切过去的必要。

评论(0)

发表评论

Advertisement 728 × 90

Sakana 模型对比

模型 上下文 定价 API 发布 全球热度
Fugu Ultra v2
1M $5.000 / $30.000 per 1M YES 2026-09
1M $2.000 / $6.000 per 1M YES 2026-09
262K $0.950 / $4.000 per 1M YES 2026-08
33/100
1M $5.000 / $30.000 per 1M YES 2026-06
39/100

类似模型

Fugu Ultra
27
Fugu Ultra 挺特别。它自己不负责答题,而是把 GPT、Claude、Gemini 叫过来干活,再负责分工和收答案。 所以看它的跑分时,我不会把它当成一个普通大模型。叫它“AI 包工头”,反而更准确。
Sakana
Sakana Namazu
15
我对 Namazu 最感兴趣的地方,不是“Sakana 又出了一个日本模型”,而是它到底改了什么。 底层直接用 Kimi K2.6,Sakana 没重新造基座,主要精力放在日语后训练、工具调用和 API 产品化上。做完这一层,token 价格也没往上抬,还是 Kimi K2.6 原来的水平。
Sakana
Fugu Max
Sakana AI 在 9 月 11 日同时发布了 Fugu Ultra v2 和 Fugu Max。 两者使用的是同一套多模型编排架构,但优化方向不同。Ultra v2 更偏向追求输出质量,Fugu Max 则把重点放在降低调用成本。
Sakana
Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba