Granite 4.1 8B

1.25
Granite 4.1 8B 是 IBM 新一代开源模型,Apache 2.0、128K 上下文,FP8 量化后约 8GB 显存就能跑。 它不追求榜单第一,胜在功能齐、部署门槛低,终于更像一个真正能放进项目里的 8B 模型。
Advertisement 728 × 90
公司Ibm Granite
上下文131K
发布日期2026-04
更新日期2026-09-03

Granite 4.1 8B 概述

Granite 4.1 是 IBM 在 2026 年 6 月 17 日发布的新一代开源模型系列,包括 2B、8B 和 20B。本文主要看 8B 版本。

Granite 4.1 8B 同时提供基座模型和指令模型,权重都采用 Apache 2.0 协议。下载、微调、商用都可以,不需要额外向 IBM 申请授权。

上下文窗口是 128K,处理企业文档、代码库和长对话基本够用。

语言方面更偏欧美市场,训练覆盖英语、法语、西班牙语、德语和葡萄牙语。中文能用,但不是它的强项。

IBM 给它的定位也很清楚:不是拿来冲排行榜第一,而是做企业里真能部署的实用模型。

代码、指令遵循、RAG、工具调用这些企业常用能力都做了。

第三方成绩也不差。Granite 4.1 8B 在 Open LLM Leaderboard v2 排到第四,在多项内外部基准里超过同尺寸的 Llama 4.1 Scout 和 Qwen 3.5 8B。

它最突出的地方不是某一项特别夸张。

而是 8B 这个体量下,很难找到特别明显的短板。

Granite 4.1 8B 定价

套餐价格说明
IBM watsonx API(按量) 输入 $0.10 / 百万 Token;输出 $0.30 / 百万 Token IBM 官方托管,适合需要 SLA 和企业支持的团队
IBM watsonx(包月) $150 / 月,含 3M 输入 Token + 1M 输出 Token 适合调用量相对稳定的团队
Together AI API 输入 $0.10 / 百万 Token;输出 $0.30 / 百万 Token 第三方托管,价格和官方一致
Cerebras API 未公开,需联系销售 针对 Cerebras 硬件优化
自托管 模型免费,只承担硬件和运维成本 Apache 2.0,可自行部署和微调

Granite 4.1 8B 真正拉低门槛的是本地部署。

FP8 量化后大约 8GB 显存就能跑,指令版约 9GB。这个级别已经进入消费级显卡的范围。

个人开发者和小团队终于不用为了一个企业向开源模型先准备服务器机柜。

Granite 4.1 8B 主要功能

1. 指令遵循:企业应用更看重这一项

Granite 4.1 8B 在指令遵循上比较稳。

ChatRAG-Bench 得分 71.12,多轮对话和长上下文任务里的表现也比较稳定。

这类能力听起来不如“数学满分”抢眼,但放到企业环境里很重要。

客服要按格式回复,知识库要围绕资料回答,内部 Agent 要按步骤调用工具。模型如果总喜欢自己加戏,分数再高也很难用。

Granite 的路子反而比较克制:让它干什么,它大多就老老实实干什么。

2. 代码能力:8B 里够扎实

HumanEval 得分 79.3,MBPP 是 70.2

放在 8B 模型里属于不错的水平。

常见的 Python、Java、C++、JavaScript、Go、Rust 都覆盖。

IBM 在训练里用了大量带许可协议的代码数据。对企业内部开发工具来说,这一点也比单纯多几个代码 benchmark 分更实际——至少合规路径更容易讲清楚。

3. RAG 和工具调用:这才是 IBM 的主场

Granite 4.1 8B 对 RAG 和工具调用投入不少。

BFCL v3 得分 78.18,在 8B 模型里属于中上水平。

如果只是聊天,这个成绩看着没什么。

企业应用就完全是另一回事:查内部数据库、调 CRM、读知识库、接业务 API,模型能不能稳定调用工具,往往比文风自然不自然重要得多。

Granite 从一开始就不是冲着“陪聊”设计的。

4. 128K 上下文,多语言够用但偏科

128K 在 2026 年已经不算夸张。

但拿来处理合同、内部知识库、代码仓库或者长对话,空间已经够大。

多语言则明显偏欧洲语言。英语、法语、西班牙语、德语、葡萄牙语支持更成熟。

中文不是不能做,只是如果业务主要靠中文,最好先拿真实数据跑一遍,别看完英文 benchmark 就直接上生产。

总结

优势

  • Apache 2.0,商用和微调限制少
  • FP8 后约 8GB 显存即可运行
  • 指令遵循、代码、RAG、工具调用都比较均衡
  • 128K 上下文
  • 基座版和指令版都有
  • IBM API 路线提供企业 SLA 和合规支持

限制

  • 纯文本模型,不支持多模态
  • 中文不是强项
  • API 单价比 DeepSeek 等低价模型高
  • 单项 benchmark 不是顶尖水平

推荐人群

  • 想找一个稳定、好部署的企业开源模型
  • 对数据隐私有要求,希望本地运行的团队
  • 做 RAG、知识库和工具调用的企业应用
  • 已经在 IBM watsonx 生态里的客户
  • 想用消费级 GPU 跑 8B 模型的开发者

不推荐人群

  • 只追 benchmark 第一名
  • 主要业务语言是中文
  • API 用量巨大、极度看重 Token 单价
  • 需要图片、音频或视频能力的项目

评论(0)

发表评论

Advertisement 728 × 90

Ibm Granite 模型对比

模型 上下文 定价 API 发布 全球热度
Granite 4.1 8B
131K $0.050 / $0.100 per 1M YES 2026-04
41/100
131K $0.100 / $0.150 per 1M YES 2026-08
43/100

类似模型

Granite 4.2 8B
26
提到 IBM 的模型,很多人先想到的还是企业、安全、合规。 但 Granite 4.2 8B 这次有点不一样。 8B 的参数规模,成绩能追上甚至压过不少更大的模型,API 价格也低。更重要的是,它还是 Apache 2.0 开源,能下载、能微调,也能自己部署。
Ibm Granite
Doubao Pro
100
豆包 Pro 最让我意外的,是那次 18 小时芯片设计任务:9 轮迭代,最后交出 1303 行 RTL 代码。这让我愿意认真看它的 Agent 能力。但一个漂亮案例,还不足以让我放心把长任务彻底交出去。
ByteDance
Qwen3-235B
99
Qwen3-235B-A22B 最让我感兴趣的,是 2350 亿总参数、每次只激活 220 亿这组数字。 模型很大,真正跑起来却没想象中那么“重”。只是切到思考模式后,输出价格会明显上去,用之前最好先把账算明白。
Alibaba
Qwen3.7 Max
99
2026中国最强AI,深度推理+自主执行,从对话到实干。 日英
Alibaba
Qwen3.8 Max
98
8月3日,阿里发布新一代旗舰模型 Qwen3.8-Max。总参数量 2.4 万亿,每次推理激活约 950 亿参数,上下文窗口达到 100 万 Token。 官方给它的定位也很明确:不只负责写几段代码,而是可以从需求拆解开始,一路写代码、调试、迭代,最后把项目交出来。
Alibaba
Qwen3.8 Flash
98
2026 年 8 月 26 日,阿里千问团队发布 Qwen3.8-Flash,并同步开源模型权重。这是一款主打性价比的多模态 MoE 模型。它不追求单项能力拉满,更像一款面向开发者和实际业务的工具型模型。
Alibaba
Qwen3.6 Flash
97
阿里放出了 Qwen3.6 Flash 后,开发者圈里的讨论不少。我连续测了几天,感受比较明确:它不是冲着系列最强性能去的,优势主要在速度、价格和多模态能力之间的平衡。
Alibaba
Qwen3.7 Plus
96
个人认为Qwen3.7 Plus是阿里开始把多模态 Agent 真正往“干活”这件事上推了。 它能看屏幕、操作界面、写代码,再自己检查结果。单项能力未必最强,但把这些事串起来之后,实用性反而更值得看。
Alibaba