Granite 4.2 8B

提到 IBM 的模型,很多人先想到的还是企业、安全、合规。 但 Granite 4.2 8B 这次有点不一样。 8B 的参数规模,成绩能追上甚至压过不少更大的模型,API 价格也低。更重要的是,它还是 Apache 2.0 开源,能下载、能微调,也能自己部署。
Advertisement 728 × 90
公司Ibm Granite
上下文131K
发布日期2026-08
更新日期2026-09-03

Granite 4.2 8B 概述

Granite 4.2 是 IBM 在 2026 年 8 月下旬发布的新一代密集语言模型系列,有 3B、8B 和 30B 三个版本。

Granite 4.2 8B 卡在中间,性能、部署成本和硬件要求比较均衡,也是这一代里更适合通用企业场景的型号。

模型基于 Apache 2.0 协议开源,可以直接下载、微调,再部署到自己的服务器。

这一代加入了原生推理能力。模型支持三种思考模式:完整思考、不思考、低强度思考,可以按任务复杂度切换,不需要换模型。

Granite 4.2 8B 主要覆盖代码生成、工具调用、多步骤推理和多语言对话,支持中、英、日、法等 12 种语言。

上下文窗口是 131K Token,处理长文档、代码库或者企业知识库基本够用。

Granite 4.2 8B 定价

套餐价格说明
IBM 官方 API 输入 0.06 美元 / 百万 Token;输出 0.25 美元 / 百万 Token 官方托管,接入最省事,适合不想自己维护推理环境的团队
OpenRouter API 输入 0.10 美元 / 百万 Token;输出 0.15 美元 / 百万 Token 第三方聚合平台,适合本来就在 OpenRouter 上管理多个模型的用户
自托管 模型免费,只承担硬件和运维成本 Apache 2.0 开源,可下载、微调、部署到自己的服务器,适合重视数据隐私和长期成本的企业

Granite 4.2 8B 主要功能

1. 推理能力:8B 不只是靠“小”取胜

Granite 4.2 8B 这代比较值得看的,是 IBM 对训练流程做了调整。

模型先经过基础强化学习,用来加强数学、编程和推理能力。

8B 和 30B 还多了一阶段 Agent 强化学习,主要针对软件工程、终端编程和搜索驱动工作流。

成绩确实涨得明显:

  • AIME25:86.67%
  • GPQA:64.14%
  • MMLU-Pro:74.04%

放在 8B 这个体量里,这组成绩已经挺扎眼。

尤其是 AIME25。小模型能把数学推理推到这个分数,说明 IBM 这次在推理训练上确实下了不少功夫。

2. 代码能力:不只是补全几行代码

Granite 4.2 的代码训练里,用到了 IBM CodeAlchemy 流水线生成的 1 万亿 Token 合成代码

SWE-Bench Verified 得分是 47.67%

对 8B 模型来说,这个成绩已经不低。

它能做的也不只是代码补全。

理解代码库、处理连续开发步骤、在终端里执行命令,这些都在训练目标里。

接到 OpenHands 这类 Agent 框架后,它可以先规划,再改代码、跑命令、看结果,然后继续下一步。

真拿来做开发任务时,这种能力比“会不会写几行代码”重要得多。

3. 工具调用:不是看到工具就乱调

Granite 4.2 8B 在工具调用上也做了专门训练。

它不是收到请求后马上挑一个工具执行,而是先判断该用什么、为什么要用,再继续下一步。

τ³-bench 上,它拿到了 68.05%

这个测试更接近多工具、多步骤的工作流,而不是单次函数调用。

如果模型要连续查数据库、调用 API、跑脚本,再把结果拼起来,中间任何一步选错工具,后面很容易一起跑偏。

所以工具调用这件事,真正难的不是“会不会调”,而是“会不会选对”。

4. 三种思考模式,确实挺实用

Granite 4.2 8B 可以在同一个模型里切换三种推理模式:

  • 完整思考:适合数学、代码和复杂任务
  • 不思考:直接回答,适合简单问答,也更省 Token
  • 低强度思考:介于两者之间,适合中等难度任务

这个设计放在真实业务里挺实用。

一句文本分类和一段复杂代码分析,如果都开最高推理强度,成本和延迟都会白白增加。

能在同一个模型里调档,比为了不同任务维护几套模型省事不少。

相比 Granite 4.0,改了什么?

Granite 4.2 的变化主要在训练方式。

3B、8B、30B 都加入了基础强化学习,8B 和 30B 又多了一轮 Agent 强化学习。另外还有 1 万亿 Token 合成代码训练,以及新的中间训练阶段。

如果非要用一句话区分:

Granite 4.0 像个聪明的答题者,Granite 4.2 开始像个能自己把任务跑完的同事。

它不只追求回答正确,还开始强调规划、执行、工具调用和连续处理任务的能力。

总结

优势

  • Apache 2.0 开源,可以下载、微调和商用
  • IBM 官方 API 输入只要 0.06 美元 / 百万 Token
  • 8B 规模下,数学、代码和工具调用成绩都不错
  • 三种思考模式可以按任务切换
  • 支持云 API,也支持本地部署
  • FP16 大约需要 19GB 显存,部署门槛不算高
  • 131K 上下文,处理企业长文档和代码库够用

限制

  • 只支持文本,不是多模态模型
  • 虽然支持 12 种语言,但训练仍以英语为主,非英语表现可能弱一些
  • 自托管还是需要一定工程能力
  • 8B 的上限摆在那里,特别复杂的推理任务还是 30B 更合适

推荐人群

  • 想把开源模型部署到公司内部的团队
  • 对 API 成本比较敏感的开发者
  • 需要代码、推理和工具调用能力的项目
  • 正在做 Agent 或自动化工作流的工程师
  • 想拿开源模型继续微调、二次开发的人

不推荐人群

  • 需要处理图片、视频、音频的项目
  • 只做很简单的聊天和文本生成
  • 完全不想碰部署和运维,只想找一个开箱即用闭源服务的用户

Granite 4.2 8B 最让我意外的,其实不是某一个 benchmark。

而是 IBM 把一个 8B 开源模型做到了这个能力,API 价格还能压得这么低。放在企业模型里,这个组合挺少见。

它不是最强模型,也没必要硬拿去和所有旗舰正面对冲。

但如果你想找一个能自己部署、价格低、代码和推理又不弱的开源模型,Granite 4.2 8B 已经很值得认真看一眼。

评论(0)

发表评论

Advertisement 728 × 90

Ibm Granite 模型对比

模型 上下文 定价 API 发布 全球热度
Granite 4.2 8B
131K $0.100 / $0.150 per 1M YES 2026-08
131K $0.050 / $0.100 per 1M YES 2026-04
41/100

类似模型