1. 知识工作
这次 Grok 4.6 在知识工作上的表现,比很多人预想得更强。
GDPVal-AA v2 拿到 1753 分,不仅超过 GPT-5.6 Sol 的 1728,也高于 Fable 5 Max 的 1741。
这个测试更接近研究、资料分析、商业文档和知识型办公,而不是单纯聊天问答。过去提到 Grok,很多人第一反应还是实时信息和聊天风格;到了 4.6,这部分正式工作能力已经补得差不多了。
对于资料整理、研究分析和商业文档处理,它已经具备和头部模型正面竞争的实力。
2. 编程与软件工程
再看编程,变化就更明显了。
CursorBench v3.2 跑到 69.9%,比上一代的 66.7% 又往前推了一点;DeepSWE v1.1 则从 54% 直接跳到 65.9%,这个幅度更值得关注。
也就是说,4.6 的提升已经不只停留在“更会写代码”。代码理解、Bug 修复、修改现有项目这些更接近真实开发流程的任务,也明显成熟了。
不过真碰到重型软件工程,差距还在。GPT-5.6 Sol 的 DeepSWE 是 73%;Terminal-Bench 上,Grok 4.6 只有 26%,GPT-5.6 则是 34.6%。
所以日常 Coding、改 Bug、做 Agent 没什么大问题,但命令行操作、复杂环境配置、跨项目修改这些任务,还不能完全和最强模型画等号。
3. Agent 与自动化
Agent 这块,Grok 4.6 的特点不是某一个单项特别夸张,而是整个执行链条开始更像样了。
APEX-Agents 得分 57.5%,略高于 GPT-5.6 Sol 的 56.7%。任务拆解、调用工具、读取结果,再继续往下执行,这套流程已经比较成熟。
拿它跑一般自动化、研究 Agent 或开发工作流,能力基本够用。
它现在更像一个执行速度很快、但还得偶尔盯一下的助手。短任务通常没什么问题,一旦连续跑几十甚至上百步,后半段还是可能出现遗漏或者执行偏移。
所以它已经能做长程 Agent,但距离“任务丢进去,人完全不用管”还有一段距离。
4. 长上下文与多模态
Grok 4.6 提供 50 万 Token 上下文窗口,可以一次处理比较大的代码库、长文档、表格和 Agent 历史记录。
代码、PDF、文档、表格都能处理,同时还支持图像生成和交互式项目,多模态能力比较完整。
50 万 Token 对大部分企业和开发场景已经够用,不过长 Agent 任务不能只看上下文上限。超过 20 万 Token 后,API 会进入更高的计费档位,实际使用时最好控制上下文膨胀。
5. 相比 Grok 4.5,进化了多少?
这一代主要加了更长时间的补充训练、更多工程类数据,以及针对编码和知识工作的强化学习。
从结果看,升级并不是平均铺开的。
CursorBench v3.2 从 Grok 4.5 的 66.7% 提升到 69.9%,属于稳步往前;DeepSWE v1.1 则从 54% 拉到 65.9%,这一项的变化要明显得多。
知识工作和 Agent 也一起往上走。4.6 已经不只是把上一代做得更快,而是把软件工程、知识处理和长任务执行整体往前推了一档。
但短板也还在。复杂命令行操作、超长 Agent 的收尾稳定性,以及真正重型的软件工程任务,依然是它和最强模型之间比较明显的差距。
评论(0)