马斯克说话向来得打个折。之前那些夸张宣传可以先放一边,但这次 Grok 4.6 的成绩确实不差。 Artificial Analysis 综合智力指数拿到 61 分,和 GPT-5.6 Sol 持平,只比 Fable 5 Max 低 1 分。再看 API 价格,Grok 这次明显是奔着开发者市场来的。
Advertisement 728 × 90
公司xAI
上下文500K
发布日期2026-08
更新日期2026-08-17

Grok 4.6 概述

Grok 4.6 是 SpaceXAI 最新旗舰模型,重点放在长程 Agent、编程和知识工作。
它提供 50 万 Token 上下文窗口,知识截止时间为 2026 年 2 月,可以处理代码、文档、表格、PDF 等内容,同时支持图像生成和交互式项目。
GDPVal-AA v2 得分 1753,高于 GPT-5.6 Sol 的 1728 和 Fable 5 Max 的 1741;CursorBench v3.2 达到 69.9%;APEX-Agents 为 57.5%,略高于 GPT-5.6 Sol 的 56.7%。
DeepSWE v1.1 达到 65.9%,虽然进步明显,但和 GPT-5.6 Sol 的 73% 还有差距。日常 Coding、知识工作和 Agent 已经很强,碰到跨仓库修改、复杂重构这类重型软件工程,头部模型还是更稳。
目前可以通过 Cursor、Grok Build、SpaceXAI API、OpenRouter、Vercel 和 Cloudflare 等渠道使用。

Grok 4.6 定价

套餐价格说明
标准 API 输入 $2 / 百万 Token;输出 $6 / 百万 Token 适用于 20 万 Token 以内。按汇率 6.8 粗算,约人民币 13.6 元输入 / 40.8 元输出。
长上下文 API 输入 $4 / 百万 Token;输出 $12 / 百万 Token 超过 20 万 Token 后,整条请求按高价档计费,而不是只计算超出的部分。
Fast 版本 输入 $4 / 百万 Token;输出 $12 / 百万 Token 用更高价格换速度,适合实时交互和延迟敏感场景。
Cursor / Grok Build 首周双倍用量 发布首周免费额度按 2 倍计算,适合开发者直接测试。
Grok / SuperGrok SuperGrok 约 $30 / 月 普通用户直接订阅即可,不需要自己接 API。

作为参考,GPT-5.6 Sol Max 的输入 / 输出价格为 $5 / $30,Claude Opus 5 为 $5 / $25。Grok 4.6 标准 API 的价格明显低一档。

Agent 用户要特别留意 20 万 Token 这条线。文件、工具返回结果和测试日志不断累积后,很容易进入长上下文档位,成本也会跟着翻倍。

Grok 4.6 主要功能

1. 知识工作

这次 Grok 4.6 在知识工作上的表现,比很多人预想得更强。

GDPVal-AA v2 拿到 1753 分,不仅超过 GPT-5.6 Sol 的 1728,也高于 Fable 5 Max 的 1741。

这个测试更接近研究、资料分析、商业文档和知识型办公,而不是单纯聊天问答。过去提到 Grok,很多人第一反应还是实时信息和聊天风格;到了 4.6,这部分正式工作能力已经补得差不多了。

对于资料整理、研究分析和商业文档处理,它已经具备和头部模型正面竞争的实力。

2. 编程与软件工程

再看编程,变化就更明显了。

CursorBench v3.2 跑到 69.9%,比上一代的 66.7% 又往前推了一点;DeepSWE v1.1 则从 54% 直接跳到 65.9%,这个幅度更值得关注。

也就是说,4.6 的提升已经不只停留在“更会写代码”。代码理解、Bug 修复、修改现有项目这些更接近真实开发流程的任务,也明显成熟了。

不过真碰到重型软件工程,差距还在。GPT-5.6 Sol 的 DeepSWE 是 73%;Terminal-Bench 上,Grok 4.6 只有 26%,GPT-5.6 则是 34.6%。

所以日常 Coding、改 Bug、做 Agent 没什么大问题,但命令行操作、复杂环境配置、跨项目修改这些任务,还不能完全和最强模型画等号。

3. Agent 与自动化

Agent 这块,Grok 4.6 的特点不是某一个单项特别夸张,而是整个执行链条开始更像样了。

APEX-Agents 得分 57.5%,略高于 GPT-5.6 Sol 的 56.7%。任务拆解、调用工具、读取结果,再继续往下执行,这套流程已经比较成熟。

拿它跑一般自动化、研究 Agent 或开发工作流,能力基本够用。

它现在更像一个执行速度很快、但还得偶尔盯一下的助手。短任务通常没什么问题,一旦连续跑几十甚至上百步,后半段还是可能出现遗漏或者执行偏移。

所以它已经能做长程 Agent,但距离“任务丢进去,人完全不用管”还有一段距离。

4. 长上下文与多模态

Grok 4.6 提供 50 万 Token 上下文窗口,可以一次处理比较大的代码库、长文档、表格和 Agent 历史记录。

代码、PDF、文档、表格都能处理,同时还支持图像生成和交互式项目,多模态能力比较完整。

50 万 Token 对大部分企业和开发场景已经够用,不过长 Agent 任务不能只看上下文上限。超过 20 万 Token 后,API 会进入更高的计费档位,实际使用时最好控制上下文膨胀。

5. 相比 Grok 4.5,进化了多少?

这一代主要加了更长时间的补充训练、更多工程类数据,以及针对编码和知识工作的强化学习。

从结果看,升级并不是平均铺开的。

CursorBench v3.2 从 Grok 4.5 的 66.7% 提升到 69.9%,属于稳步往前;DeepSWE v1.1 则从 54% 拉到 65.9%,这一项的变化要明显得多。

知识工作和 Agent 也一起往上走。4.6 已经不只是把上一代做得更快,而是把软件工程、知识处理和长任务执行整体往前推了一档。

但短板也还在。复杂命令行操作、超长 Agent 的收尾稳定性,以及真正重型的软件工程任务,依然是它和最强模型之间比较明显的差距。

总结

优势

Grok 4.6 在知识工作、Agent 和编程上已经有第一梯队的竞争力。尤其 DeepSWE 从 54% 涨到 65.9%,说明这一代的软件工程能力并不是小修小补。

价格也足够有杀伤力。标准 API 输入 2 美元、输出 6 美元 / 百万 Token,对需要大量调用模型的产品来说,成本优势很直接。

限制

复杂软件工程仍然没有完全追上 GPT-5.6 Sol,Terminal-Bench 的表现也比较一般。长程 Agent 虽然比以前稳,但还做不到把特别复杂的任务丢进去之后完全不管。

20 万 Token 之后整条请求进入高价档,也是长 Agent 项目需要提前算清楚的一笔账。

推荐人群

做 Coding Agent、AI 编程辅助、自动化工作流、知识处理和研究 Agent 的开发者比较适合,尤其是调用量大、对推理成本敏感的个人开发者和创业团队。

Cursor 用户也很适合直接拿真实项目测试,看看它能不能替掉一部分更贵的模型调用。

不推荐人群

只追求模型绝对上限、不太关心调用成本的人,没有必要为了便宜特意换 Grok。

需要 Agent 长时间无人值守,而且任务包含大量复杂软件工程操作的团队,也更适合先测试稳定性,再决定是否大范围接入。

评论(0)

发表评论

Advertisement 728 × 90

xAI 模型对比

模型 上下文 定价 API 发布 全球热度
Grok 4.6
500K $2.000 / $6.000 per 1M YES 2026-08
500K $2.000 / $6.000 per 1M YES 2026-07
93/100
256K $1.000 / $2.000 per 1M YES 2026-05
61/100
1M $1.250 / $2.500 per 1M YES 2026-04
88/100
128K 免费增值 YES 2025-02
90/100

类似模型

关联工具

相关新闻