1. Schema 驱动的数据提取
Schematron 最核心的地方,就是它不靠 prompt 驱动。
你不是告诉它:
“帮我找到商品信息。”
而是提前定义:
模型负责把网页内容映射到这些字段。
对于批量数据入库,这种方式比调用通用模型再清洗结果更直接。
但它没有多少自由发挥空间。
页面结构变化,Schema 也需要跟着改。
所以它更像一个数据处理组件,而不是网页分析助手。
2. 长页面处理能力
Schematron V2 Small 支持 128K token 上下文,针对长 HTML 做了优化。
Inference.net 提到,它可以处理真实网页里的复杂标记和混乱结构。
这一点我觉得比单纯的 benchmark 更有价值。
真实网页很少是干净的正文。
大量广告代码、嵌套标签、无关元素都会影响提取效果。
如果模型能少依赖人工清洗,实际部署会方便很多。
当然,官方仍建议使用 lxml 等工具处理 script 和 style。
我不会太关注它在测试集上的格式得分差 0.01。
生产环境里,更重要的是:每天处理几万页面时,它能不能稳定少出错。
3. 小模型带来的速度和成本优势
Schematron V2 Small 只有 3B 参数。
这也是它价格低的重要原因。
Inference.net 公布的数据中,在单张 H100 上,它的吞吐为 2.47 requests/sec,测试条件为 10K 输入 token 加 500 输出 token。
这个速度不算顶级。
但它本来也不是为复杂推理设计的。
它的目标更像是大量重复任务:输入网页,输出结构化数据。
Benchable 测试显示,它在速度维度排名第 93 百分位,可靠性为 100%。
这些数字可以参考,但我更想看真实业务里的失败率。
一个提取模型,偶尔格式错误造成的数据返工,比慢一点更麻烦。
4. 相比上一代,3B 版本接近 8B 效果
Schematron V1 有 3B 和 8B 两个版本。
V2 Small 的目标,是用更小的模型达到接近 8B 版本的效果。
Inference.net 使用 GPT-5.4 作为 LLM-as-judge:
- V2 Small:4.060
- V1 8B:4.070
- V1 3B:3.909
在 SimpleQA 测试中:
- V2 Small + GPT-5 Nano + Exa:83.10
- V1 8B:85.58
单看数字,8B 仍然略高。
但我觉得这个差距放到生产环境里,未必能明显感受到。
如果每天处理几十万条网页数据,成本、速度和稳定性可能比那一点评分差距更重要。
这也是 V2 Small 的价值所在:用更小的模型,把实际可用性做上去。
评论(0)