Schematron V2 Small

Inference.net 在 9 月 12 日上线了 Schematron V2 Small。它不是一个通用模型,只负责一件事:把 HTML 转成 JSON。
Advertisement 728 × 90
公司Inference Net
上下文128K
发布日期2026-09
更新日期2026-09-15

Schematron V2 Small 概述

Schematron V2 Small 是 Inference.net 的 HTML-to-JSON 提取模型,参数量为 3B,基于 Llama 3.2 3B 微调。

它和普通聊天模型最大的区别,是使用方式。

我一开始以为它也能像普通模型一样,通过 prompt 告诉它“帮我提取商品名称、价格和库存”。实际使用时发现不是这样。

Schematron 不听自然语言指令。

你需要提前定义 JSON Schema,把字段、类型、结构写清楚,再放进 API 请求的 response_format 中。

模型读取 HTML 后,只负责按照 Schema 输出 JSON。

这个设计牺牲了一些灵活性,但换来了稳定性。

字段名、数据类型、必填项都被固定下来,不需要每次生成后再修格式。

如果网页结构变化,问题也很明确:改 Schema。

而不是不断调整 prompt 猜模型为什么漏字段。

Schematron V2 Small 支持 128K token 上下文,单次最大输出 4096 token。

主要面向:

网页抓取
商品数据入库
金融文档解析
结构化数据提取

模型权重目前没有开源,只能通过 API 使用。

Schematron V2 Small 定价

套餐价格说明
API 按量计费 输入 $0.05 / 1M tokens;输出 $0.23 / 1M tokens 按实际 token 消耗计费

目前没有订阅套餐。

Inference.net 官方也没有公开免费层,部分平台可能提供试用额度。

它的价格非常低,但前提是任务刚好符合它的能力范围。

如果拿它做网页提取,成本优势明显。

如果想让它完成通用 AI 任务,低价格没有意义。

Schematron V2 Small 主要功能

1. Schema 驱动的数据提取

Schematron 最核心的地方,就是它不靠 prompt 驱动。

你不是告诉它:

“帮我找到商品信息。”

而是提前定义:

  • 商品名称
  • 价格
  • 分类
  • 参数字段

模型负责把网页内容映射到这些字段。

对于批量数据入库,这种方式比调用通用模型再清洗结果更直接。

但它没有多少自由发挥空间。

页面结构变化,Schema 也需要跟着改。

所以它更像一个数据处理组件,而不是网页分析助手。


2. 长页面处理能力

Schematron V2 Small 支持 128K token 上下文,针对长 HTML 做了优化。

Inference.net 提到,它可以处理真实网页里的复杂标记和混乱结构。

这一点我觉得比单纯的 benchmark 更有价值。

真实网页很少是干净的正文。

大量广告代码、嵌套标签、无关元素都会影响提取效果。

如果模型能少依赖人工清洗,实际部署会方便很多。

当然,官方仍建议使用 lxml 等工具处理 script 和 style。

我不会太关注它在测试集上的格式得分差 0.01。

生产环境里,更重要的是:每天处理几万页面时,它能不能稳定少出错。


3. 小模型带来的速度和成本优势

Schematron V2 Small 只有 3B 参数。

这也是它价格低的重要原因。

Inference.net 公布的数据中,在单张 H100 上,它的吞吐为 2.47 requests/sec,测试条件为 10K 输入 token 加 500 输出 token。

这个速度不算顶级。

但它本来也不是为复杂推理设计的。

它的目标更像是大量重复任务:输入网页,输出结构化数据。

Benchable 测试显示,它在速度维度排名第 93 百分位,可靠性为 100%。

这些数字可以参考,但我更想看真实业务里的失败率。

一个提取模型,偶尔格式错误造成的数据返工,比慢一点更麻烦。


4. 相比上一代,3B 版本接近 8B 效果

Schematron V1 有 3B 和 8B 两个版本。

V2 Small 的目标,是用更小的模型达到接近 8B 版本的效果。

Inference.net 使用 GPT-5.4 作为 LLM-as-judge:

  • V2 Small:4.060
  • V1 8B:4.070
  • V1 3B:3.909

在 SimpleQA 测试中:

  • V2 Small + GPT-5 Nano + Exa:83.10
  • V1 8B:85.58

单看数字,8B 仍然略高。

但我觉得这个差距放到生产环境里,未必能明显感受到。

如果每天处理几十万条网页数据,成本、速度和稳定性可能比那一点评分差距更重要。

这也是 V2 Small 的价值所在:用更小的模型,把实际可用性做上去。

总结

我会把 Schematron V2 Small 用在:

  • 商品信息抓取;
  • 网页数据入库;
  • 大量 HTML 转结构化数据;
  • 固定格式文档解析。

这些任务里,我需要的是稳定输出 JSON,而不是模型帮我理解世界。

我不会拿它做:

  • 内容总结;
  • 复杂分析;
  • 页面价值判断;
  • 通用聊天。

如果任务需要模型思考“这个页面表达了什么”,Schematron 不是合适选择。

如果任务只是把网页里的信息稳定搬进数据库,它反而可能比更大的通用模型更实用。

评论(0)

发表评论

Advertisement 728 × 90

Inference Net 模型对比

模型 上下文 定价 API 发布 全球热度
Schematron V2 Small
128K $0.050 / $0.230 per 1M YES 2026-09
128K $0.030 / $0.150 per 1M YES 2026-09

类似模型

Schematron V2 Turbo
Inference.net 在 9 月 12 日发布了 Schematron V2 Turbo,与 V2 Small 同一天上线。两者做的是同一件事:把 HTML 转成 JSON。区别在于侧重点。V2 Small 更偏向提取质量,Turbo 更偏向处理速度和吞吐量。
Inference Net
Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
96
个人认为Qwen3.7 Plus是阿里开始把多模态 Agent 真正往“干活”这件事上推了。 它能看屏幕、操作界面、写代码,再自己检查结果。单项能力未必最强,但把这些事串起来之后,实用性反而更值得看。
Alibaba