Schematron V2 Turbo

Inference.net 在 9 月 12 日发布了 Schematron V2 Turbo,与 V2 Small 同一天上线。两者做的是同一件事:把 HTML 转成 JSON。区别在于侧重点。V2 Small 更偏向提取质量,Turbo 更偏向处理速度和吞吐量。
Advertisement 728 × 90
公司Inference Net
上下文128K
发布日期2026-09
更新日期2026-09-15

Schematron V2 Turbo 概述

Schematron V2 Turbo 是 Inference.net 的 HTML-to-JSON 提取模型。

它有 3B 参数,和 V2 Small 使用相同基础模型。

它的工作方式和普通聊天模型不一样。

我一开始也以为可以直接输入:

“提取商品价格。”

然后让模型自己理解。

实际不是这样。

Schematron 不使用自然语言 prompt 控制任务,所有提取规则都需要提前写入 JSON Schema,再放到 API 请求的 response_format 中。

模型读取 HTML 后,只负责按照 Schema 返回 JSON。

这种设计换来了稳定性。

字段名、类型和结构都提前确定,不需要每次输出后再额外清理格式。

代价也很明显:灵活性降低。

页面结构变化,需要修改 Schema,而不是换一句 prompt。

Turbo 支持 128K token 上下文,最大输出约 8K token。

主要用于:

网页抓取
商品数据入库
金融文档解析
大规模结构化提取

模型权重不开源,只能通过 API 使用。

Schematron V2 Turbo 定价

套餐价格说明
API 按量计费 输入 $0.03 / 1M tokens;输出 $0.15 / 1M tokens 按实际 token 消耗计费

相比 V2 Small:

  • 输入价格低约 40%
  • 输出价格低约 40%

官方给出的计算是:

处理 10 万个页面,每页 10K 输入 token、500 输出 token:

  • V2 Small 约 $62.50
  • V2 Turbo 约 $37.50

Schematron V2 Turbo 主要功能

1. 吞吐量优先

这是 Turbo 存在的主要原因。

在单张 H100、10K 输入 token + 500 输出 token 的测试条件下,Turbo 达到 4.14 requests/sec

对比:

  • V2 Small:2.47 requests/sec
  • 初代 8B:约 1.66 requests/sec

Turbo 比 V2 Small 快约 1.7 倍,比初代 8B 快约 2.5 倍。

这种提升放在普通调用里可能感觉不到。

但对于实时爬虫、价格监控、金融文档解析这类持续运行的任务,吞吐量会直接影响整体成本。

如果让我选,我不会用 Turbo 处理少量、高价值页面。

它更适合大量重复任务。


2. 质量接近 Small,但不是最高

Turbo 的定位不是追求最高质量,而是在速度和成本之间做取舍。

Inference.net 使用 GPT-5.4 作为 LLM-as-judge(1-5 分):

  • V2 Turbo:4.039
  • V2 Small:4.060
  • V1 8B:4.070
  • V1 3B:3.909

SimpleQA 测试:

  • V2 Turbo + GPT-5 Nano + Exa:79.42
  • V2 Small:83.10

数字上,Turbo 低于 Small。

但我不太在意这几个小数点差距。

对于每天处理大量网页的数据系统,真正重要的是成本、速度和稳定性。

如果结果已经满足业务需求,再追求一点点评分提升,未必划算。


3. Schema 驱动,不靠 Prompt

Turbo 和 V2 Small 一样,只认 Schema。

你不能直接告诉它:

“帮我提取标题。”

而需要提前定义字段:

{
  "title": {
    "type": "string"
  }
}

然后让模型按照结构返回结果。

好处是输出稳定。

字段缺失、类型错误、JSON 格式混乱这些问题会减少。

缺点也很明确。

网页结构变化,需要调整 Schema。

它不是一个可以自由交流的网页助手,而是一个结构化数据处理工具。


4. 相比 V1,Turbo 是初代 3B 的升级路线

Inference.net 已经退役初代 3B 和 8B。

原本调用 schematron-3b 的请求,会自动路由到 V2 Turbo。

变化比较直接:

速度:

  • V1 3B:约 1.66 requests/sec
  • V2 Turbo:4.14 requests/sec

质量:

  • V1 3B:3.909
  • V2 Turbo:4.039

同时价格也更低。

如果之前已经在使用初代 3B,升级到 Turbo 的收益比较明确。

但它不是 Small 的替代版本。

Small 更偏质量,Turbo 更偏规模化处理。

总结

我会把 Schematron V2 Turbo 用在:

  • 大规模网页抓取;
  • 商品价格监控;
  • 批量金融文档解析;
  • HTML 转结构化数据。

这些任务需要的是稳定提取,而不是模型理解页面背后的含义。

我不会用它做:

  • 内容总结;
  • 页面价值判断;
  • 复杂分析;
  • 非结构化问答。

如果每天处理几十万甚至更多页面,Turbo 的速度和价格优势很明显。

如果只是偶尔提取几个网页,通用模型可能更方便。

对我来说,Turbo 是否值得用,判断标准很简单:

它有没有减少数据流水线里的等待时间和人工修复。

如果有,它值得留下。

如果最后还是需要大量检查结果,便宜的 API 价格也省不了多少。

评论(0)

发表评论

Advertisement 728 × 90

Inference Net 模型对比

模型 上下文 定价 API 发布 全球热度
Schematron V2 Turbo
128K $0.030 / $0.150 per 1M YES 2026-09
128K $0.050 / $0.230 per 1M YES 2026-09

类似模型

Schematron V2 Small
Inference.net 在 9 月 12 日上线了 Schematron V2 Small。它不是一个通用模型,只负责一件事:把 HTML 转成 JSON。
Inference Net
Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
96
个人认为Qwen3.7 Plus是阿里开始把多模态 Agent 真正往“干活”这件事上推了。 它能看屏幕、操作界面、写代码,再自己检查结果。单项能力未必最强,但把这些事串起来之后,实用性反而更值得看。
Alibaba