1. 吞吐量优先
这是 Turbo 存在的主要原因。
在单张 H100、10K 输入 token + 500 输出 token 的测试条件下,Turbo 达到 4.14 requests/sec。
对比:
- V2 Small:2.47 requests/sec
- 初代 8B:约 1.66 requests/sec
Turbo 比 V2 Small 快约 1.7 倍,比初代 8B 快约 2.5 倍。
这种提升放在普通调用里可能感觉不到。
但对于实时爬虫、价格监控、金融文档解析这类持续运行的任务,吞吐量会直接影响整体成本。
如果让我选,我不会用 Turbo 处理少量、高价值页面。
它更适合大量重复任务。
2. 质量接近 Small,但不是最高
Turbo 的定位不是追求最高质量,而是在速度和成本之间做取舍。
Inference.net 使用 GPT-5.4 作为 LLM-as-judge(1-5 分):
- V2 Turbo:4.039
- V2 Small:4.060
- V1 8B:4.070
- V1 3B:3.909
SimpleQA 测试:
- V2 Turbo + GPT-5 Nano + Exa:79.42
- V2 Small:83.10
数字上,Turbo 低于 Small。
但我不太在意这几个小数点差距。
对于每天处理大量网页的数据系统,真正重要的是成本、速度和稳定性。
如果结果已经满足业务需求,再追求一点点评分提升,未必划算。
3. Schema 驱动,不靠 Prompt
Turbo 和 V2 Small 一样,只认 Schema。
你不能直接告诉它:
“帮我提取标题。”
而需要提前定义字段:
{
"title": {
"type": "string"
}
}
然后让模型按照结构返回结果。
好处是输出稳定。
字段缺失、类型错误、JSON 格式混乱这些问题会减少。
缺点也很明确。
网页结构变化,需要调整 Schema。
它不是一个可以自由交流的网页助手,而是一个结构化数据处理工具。
4. 相比 V1,Turbo 是初代 3B 的升级路线
Inference.net 已经退役初代 3B 和 8B。
原本调用 schematron-3b 的请求,会自动路由到 V2 Turbo。
变化比较直接:
速度:
- V1 3B:约 1.66 requests/sec
- V2 Turbo:4.14 requests/sec
质量:
- V1 3B:3.909
- V2 Turbo:4.039
同时价格也更低。
如果之前已经在使用初代 3B,升级到 Turbo 的收益比较明确。
但它不是 Small 的替代版本。
Small 更偏质量,Turbo 更偏规模化处理。
评论(0)