1. 推理能力:8B 不只是靠“小”取胜
Granite 4.2 8B 这代比较值得看的,是 IBM 对训练流程做了调整。
模型先经过基础强化学习,用来加强数学、编程和推理能力。
8B 和 30B 还多了一阶段 Agent 强化学习,主要针对软件工程、终端编程和搜索驱动工作流。
成绩确实涨得明显:
- AIME25:86.67%
- GPQA:64.14%
- MMLU-Pro:74.04%
放在 8B 这个体量里,这组成绩已经挺扎眼。
尤其是 AIME25。小模型能把数学推理推到这个分数,说明 IBM 这次在推理训练上确实下了不少功夫。
2. 代码能力:不只是补全几行代码
Granite 4.2 的代码训练里,用到了 IBM CodeAlchemy 流水线生成的 1 万亿 Token 合成代码。
SWE-Bench Verified 得分是 47.67%。
对 8B 模型来说,这个成绩已经不低。
它能做的也不只是代码补全。
理解代码库、处理连续开发步骤、在终端里执行命令,这些都在训练目标里。
接到 OpenHands 这类 Agent 框架后,它可以先规划,再改代码、跑命令、看结果,然后继续下一步。
真拿来做开发任务时,这种能力比“会不会写几行代码”重要得多。
3. 工具调用:不是看到工具就乱调
Granite 4.2 8B 在工具调用上也做了专门训练。
它不是收到请求后马上挑一个工具执行,而是先判断该用什么、为什么要用,再继续下一步。
在 τ³-bench 上,它拿到了 68.05%。
这个测试更接近多工具、多步骤的工作流,而不是单次函数调用。
如果模型要连续查数据库、调用 API、跑脚本,再把结果拼起来,中间任何一步选错工具,后面很容易一起跑偏。
所以工具调用这件事,真正难的不是“会不会调”,而是“会不会选对”。
4. 三种思考模式,确实挺实用
Granite 4.2 8B 可以在同一个模型里切换三种推理模式:
- 完整思考:适合数学、代码和复杂任务
- 不思考:直接回答,适合简单问答,也更省 Token
- 低强度思考:介于两者之间,适合中等难度任务
这个设计放在真实业务里挺实用。
一句文本分类和一段复杂代码分析,如果都开最高推理强度,成本和延迟都会白白增加。
能在同一个模型里调档,比为了不同任务维护几套模型省事不少。
相比 Granite 4.0,改了什么?
Granite 4.2 的变化主要在训练方式。
3B、8B、30B 都加入了基础强化学习,8B 和 30B 又多了一轮 Agent 强化学习。另外还有 1 万亿 Token 合成代码训练,以及新的中间训练阶段。
如果非要用一句话区分:
Granite 4.0 像个聪明的答题者,Granite 4.2 开始像个能自己把任务跑完的同事。
它不只追求回答正确,还开始强调规划、执行、工具调用和连续处理任务的能力。
评论(0)