Claude Opus 5

1.45
Opus 5 最吸引我的,不是分数涨了多少,而是它把接近旗舰级的能力压到了更容易长期使用的价格。 但我不会因此把它当成一个可以完全放手的模型。任务一旦拉到数小时,稳定性还是要打个问号。
Advertisement 728 × 90
公司Anthropic
上下文1M
发布日期2026-07
更新日期2026-09-10

Claude Opus 5 概述

Claude Opus 5 是 Anthropic 在 2026 年 7 月 24 日发布的新一代旗舰模型,重点放在复杂 Agent 编程和企业任务上。

它支持文本、图像输入,能调用工具、返回结构化结果。上下文窗口 100 万 token,最大输出 12.8 万 token。

这一代还有个很直接的变化:思考默认开启。用户可以通过 effort 调整推理强度,决定模型在任务上投入多少推理资源。

Opus 5 已成为 Claude Max 的默认模型,也是 Pro 计划里能力最高的一档。

Claude Opus 5 定价

套餐价格说明
API 输入 $5 / 百万 token 与 Opus 4.8 相同
API 输出 $25 / 百万 token 与 Opus 4.8 相同
缓存输入 $0.5 / 百万 token 适合重复使用上下文
Batch API 输入 $2.5 / 输出 $12.5 价格减半,适合不着急返回的任务
Claude Pro $20 / 月 可使用 Opus 5,有用量限制
Claude Max 5x $100 / 月 5 倍用量,优先访问
Claude Max 20x $200 / 月 20 倍用量,偏向重度使用者

另有 Fast mode,速度约为标准模式的 2.5 倍,费用也翻倍。

Claude 本身有免费版本,但 Opus 5 需要付费订阅或 API

偶尔使用,Pro 的 $20/月更省事。每天大量跑开发任务,Max 20x 更合适。产品接入则直接走 API,调用多少付多少。

能接受等待的批处理任务可以用 Batch API,价格直接减半。

Claude Opus 5 主要功能

1. 四档 effort,不必每个任务都开满

Opus 5 提供 lowmediumhighmax 四档 effort。

档位提高后,模型会投入更多 token 做内部推理,代价是延迟和费用也会上升。

这个功能我觉得比单纯提高模型上限更实用。客服、代码检查这类流水线里,大部分请求没必要一直开 max。普通任务用 low 或 medium,真正棘手的再往上调。

Artificial Analysis 的测试中,Opus 5 即使用较低的 effort,成绩也超过了不少竞品的最高档表现。

2. Agent 能力更强,也更省

Opus 5 在需要自己找资料、调用工具、操作环境的任务上提升比较明显。

OSWorld 2.0 中,它用大约 Fable 5 三分之一的成本超过了后者的最高分。AutomationBench 上,在相近成本下,任务完成率达到次优模型的 1.5 倍

Anthropic 还展示过一个比较极端的例子:只给模型机械零件图纸,但不允许直接看图,让它重建 3D 模型。

Opus 5 自己写了一套计算机视觉流程,从原始像素中提取几何信息,最后完成了任务。其他模型连续尝试五次都没做成。

这种例子比“会调用工具”几个字更能说明问题。它不只是按固定步骤执行,也会临时给自己造工具。

3. 会检查自己,但有时检查过头

Anthropic 强调了 Opus 5 的自我校验能力。

它会主动验证结果、追查 bug 根因,不太容易修掉表面症状就收工。放在 Coding Agent 里,这个习惯是加分项。

System Card 里也记录了另一种情况:模型有时会陷入自我验证循环

一次生物研究任务中,Opus 5 花了 8 小时不断搭建和执行检查流程,最后没有产出结果。

所以我不会把“更会自检”直接等同于“更适合长时间无人值守”。检查本身也可能变成任务。

4. 从 Opus 4.8 到 Opus 5

Opus 4.8 发布于两个月前,两代 API 价格相同。

几个数字能看出升级幅度:

  • Frontier-Bench:18.7% → 43.3%
  • CursorBench 3.2:距离 Fable 5 最好成绩只差 0.5%,成本约为后者一半
  • 安全分类器的干预频率比 Fable 5 低约 85%

还有一个迁移时容易漏掉的变化。

Opus 5 默认开启思考功能,而且只有 effort 设在 high 或更低时才能关闭。如果现有代码按 Opus 4.8 的行为写死了,切模型时要检查这一项。

总结

Opus 5 最吸引我的,不是某一项 benchmark。

是它把一档很贵的能力,压到了更多团队真能长期用的价格。

复杂 Coding Agent、工具调用、需要大量 API 请求的产品,都比较吃这套组合。effort 又给了开发者一个控制成本的旋钮,不必所有请求都按最高推理强度跑。

它的问题也很具体。System Card 里那次长达 8 小时、最后零输出的自我验证循环,很难忽略。任务跑得越久,这种失控的代价越高。

所以我会愿意让 Opus 5 接手复杂工作,也会给它更多权限。

但如果要求它独立跑几个小时甚至几天,中间没人检查,最后直接交付结果,我还不会这么用。

它已经很接近“便宜很多的旗舰模型”了。至于能不能变成一个真正可以长期放手运行的 Agent,Opus 5 还差的是稳定把事情做完。

评论(0)

发表评论

Advertisement 728 × 90

Anthropic 模型对比

模型 上下文 定价 API 发布 全球热度
Claude Opus 5
1M $5.000 / $25.000 per 1M YES 2026-07
100/100
1M $10.000 / $50.000 per 1M YES 2026-09
95/100
1M 付费 YES 2026-06
95/100
1M 付费 YES 2026-06
95/100
1M 付费 YES 2026-05
100/100

类似模型

关联工具

相关新闻