Claude Opus 5 是 Anthropic 在 2026 年 7 月 24 日发布的新一代旗舰模型,重点放在复杂 Agent 编程和企业任务上。
它支持文本、图像输入,能调用工具、返回结构化结果。上下文窗口 100 万 token,最大输出 12.8 万 token。
这一代还有个很直接的变化:思考默认开启。用户可以通过 effort 调整推理强度,决定模型在任务上投入多少推理资源。
Opus 5 已成为 Claude Max 的默认模型,也是 Pro 计划里能力最高的一档。
Claude Opus 5 是 Anthropic 在 2026 年 7 月 24 日发布的新一代旗舰模型,重点放在复杂 Agent 编程和企业任务上。
它支持文本、图像输入,能调用工具、返回结构化结果。上下文窗口 100 万 token,最大输出 12.8 万 token。
这一代还有个很直接的变化:思考默认开启。用户可以通过 effort 调整推理强度,决定模型在任务上投入多少推理资源。
Opus 5 已成为 Claude Max 的默认模型,也是 Pro 计划里能力最高的一档。
| 套餐 | 价格 | 说明 |
|---|---|---|
| API 输入 | $5 / 百万 token | 与 Opus 4.8 相同 |
| API 输出 | $25 / 百万 token | 与 Opus 4.8 相同 |
| 缓存输入 | $0.5 / 百万 token | 适合重复使用上下文 |
| Batch API | 输入 $2.5 / 输出 $12.5 | 价格减半,适合不着急返回的任务 |
| Claude Pro | $20 / 月 | 可使用 Opus 5,有用量限制 |
| Claude Max 5x | $100 / 月 | 5 倍用量,优先访问 |
| Claude Max 20x | $200 / 月 | 20 倍用量,偏向重度使用者 |
另有 Fast mode,速度约为标准模式的 2.5 倍,费用也翻倍。
Claude 本身有免费版本,但 Opus 5 需要付费订阅或 API。
偶尔使用,Pro 的 $20/月更省事。每天大量跑开发任务,Max 20x 更合适。产品接入则直接走 API,调用多少付多少。
能接受等待的批处理任务可以用 Batch API,价格直接减半。
Opus 5 提供 low、medium、high、max 四档 effort。
档位提高后,模型会投入更多 token 做内部推理,代价是延迟和费用也会上升。
这个功能我觉得比单纯提高模型上限更实用。客服、代码检查这类流水线里,大部分请求没必要一直开 max。普通任务用 low 或 medium,真正棘手的再往上调。
Artificial Analysis 的测试中,Opus 5 即使用较低的 effort,成绩也超过了不少竞品的最高档表现。
Opus 5 在需要自己找资料、调用工具、操作环境的任务上提升比较明显。
OSWorld 2.0 中,它用大约 Fable 5 三分之一的成本超过了后者的最高分。AutomationBench 上,在相近成本下,任务完成率达到次优模型的 1.5 倍。
Anthropic 还展示过一个比较极端的例子:只给模型机械零件图纸,但不允许直接看图,让它重建 3D 模型。
Opus 5 自己写了一套计算机视觉流程,从原始像素中提取几何信息,最后完成了任务。其他模型连续尝试五次都没做成。
这种例子比“会调用工具”几个字更能说明问题。它不只是按固定步骤执行,也会临时给自己造工具。
Anthropic 强调了 Opus 5 的自我校验能力。
它会主动验证结果、追查 bug 根因,不太容易修掉表面症状就收工。放在 Coding Agent 里,这个习惯是加分项。
System Card 里也记录了另一种情况:模型有时会陷入自我验证循环。
一次生物研究任务中,Opus 5 花了 8 小时不断搭建和执行检查流程,最后没有产出结果。
所以我不会把“更会自检”直接等同于“更适合长时间无人值守”。检查本身也可能变成任务。
Opus 4.8 发布于两个月前,两代 API 价格相同。
几个数字能看出升级幅度:
还有一个迁移时容易漏掉的变化。
Opus 5 默认开启思考功能,而且只有 effort 设在 high 或更低时才能关闭。如果现有代码按 Opus 4.8 的行为写死了,切模型时要检查这一项。
Opus 5 最吸引我的,不是某一项 benchmark。
是它把一档很贵的能力,压到了更多团队真能长期用的价格。
复杂 Coding Agent、工具调用、需要大量 API 请求的产品,都比较吃这套组合。effort 又给了开发者一个控制成本的旋钮,不必所有请求都按最高推理强度跑。
它的问题也很具体。System Card 里那次长达 8 小时、最后零输出的自我验证循环,很难忽略。任务跑得越久,这种失控的代价越高。
所以我会愿意让 Opus 5 接手复杂工作,也会给它更多权限。
但如果要求它独立跑几个小时甚至几天,中间没人检查,最后直接交付结果,我还不会这么用。
它已经很接近“便宜很多的旗舰模型”了。至于能不能变成一个真正可以长期放手运行的 Agent,Opus 5 还差的是稳定把事情做完。
| 模型 | 上下文 | 定价 | API | 发布 | 全球热度 |
|---|---|---|---|---|---|
![]()
Claude Opus 5
|
1M | $5.000 / $25.000 per 1M | YES | 2026-07 |
100/100
|
| 1M | $10.000 / $50.000 per 1M | YES | 2026-09 |
95/100
|
|
| 1M | 付费 | YES | 2026-06 |
95/100
|
|
| 1M | 付费 | YES | 2026-06 |
95/100
|
|
| 1M | 付费 | YES | 2026-05 |
100/100
|
评论(0)