GPT-6 Astra

GPT-6 Astra 正式亮相。发布会上,OpenAI 总裁 Greg Brockman 直接说了一句:“欢迎来到 AGI 时代。” 看完发布会,再对照这两天陆续出来的第三方测试,我的判断是:Astra 这次升级不小,而且方向很明确。但真要把它说成“AGI 时代的起点”,还是有点早。
Advertisement 728 × 90
公司OpenAI
上下文1.1M
发布日期2026-09
更新日期2026-09-08

GPT-6 Astra 概述

GPT-6 Astra 是 OpenAI 的第六代旗舰模型,代号“Astra”来自拉丁语中的“星辰”。

和 GPT-5.6 Sol 相比,它最值得看的,不是聊天更流畅了,而是执行任务的能力更强了。

文本处理、图像识别这些能力还在,Astra 这次真正加码的是计算机操作和专业工作流。

你可以让它打开软件、填表、做 PPT、写代码、跑测试。发布会里有一段演示很有代表性:Astra 先在 Blender 里搭了一个 3D 房间,再把模型导入虚幻引擎 5,最后生成一个可以直接走进去看的场景。

这和传统聊天模型已经不是一回事了。

OpenAI 这次想推的方向很清楚:不只是回答你怎么做,而是让模型直接把事做掉。

GPT-6 Astra 定价

套餐价格说明
ChatGPT Plus 20 美元 只能在 Work 和 Codex 中使用 Astra,额度有限
ChatGPT Pro 100 美元/月 聊天界面可用 Astra,每周最多 50 条
ChatGPT Pro 高阶档 200 美元/月 聊天界面显示为 GPT-6 Pro,每周最多 200 条
Business / Enterprise 按需定价 可用 Astra 全部能力,配额和权限按企业方案调整
API 标准模式 输入 10 美元 / 百万 token;输出 50 美元 / 百万 token 按量计费,适合开发者和企业接入
API Fast 模式 标准模式约 2 倍价格 速度更快,适合对响应时间要求高的任务

GPT-6 Astra 主要功能

1. 计算机操作

这是 Astra 最核心的一项升级。

在模拟真人操作电脑的 OSWorld 2.0 测试里,Astra 得分 72.6%,高于 GPT-5.6 Sol 的 65.7%。

更有意思的是耗时。

Sol 跑完相关任务大约需要 75 分钟,Astra 压到了 40 分钟左右。分数涨了,动作也快了不少。

这种提升比 benchmark 多几分更有现实价值。

用户真正想要的,不是 AI 告诉你“下一步点哪里”,而是它自己把软件打开,把流程跑完。

2. 编程和代码能力

软件工程基准 DeepSWE v1.1 中,Astra 得分 74.1%,比 Claude Fable 5.1 高 6.7 个百分点。

成绩很好看,但测试环境得考虑进去。

OpenAI 自家的 Codex 环境本来就更适合 Astra,两者配合会有一定优势。

换到独立机构 Artificial Analysis 的 Coding Agent Index,Astra 得分 67,和主要竞品基本在一个区间,没有拉开特别大的差距。

代码能力确实强,但还没强到“甩开一代”的程度。

3. 安全性与对齐

这一项我反而更看重。

OpenAI 做过一组测试:给模型一个几乎无法正常完成的任务,再看它会不会为了交差,擅自越权、作弊或者绕过规则。

在没有额外防护的情况下,GPT-5.6 Sol 的越界概率是 48%,Astra 是 0%。

这个数字如果能在更多独立测试里复现,分量很重。

聊天模型犯一次错,很多时候最多就是答错一句话。能操作电脑、调用工具、接触文件的 Agent 一旦越权,性质完全不同。

既然 Astra 要往 Agent 方向走,权限边界就不是加分项,而是基本盘。

4. Token 效率

Astra 的 API 单价更高,但它在部分任务里确实更省 token。

以编程任务为例,Astra 的生成 token 数量大约只有 Sol 的三分之一。

只盯着每百万 token 的价格,很容易把账算偏。

如果同一个任务,Astra 用掉的 token 少很多,哪怕单价高到 2.5 倍,最后总成本也可能接近,甚至更低。

对 API 开发者来说,还是得看一件事到底花多少钱做完。

总结

Astra 到底强在哪?

最明显的是执行能力。

Astra 已经不太像一个单纯回答问题的模型了。电脑操作、软件调用、代码执行、工作流衔接,这几项能力放到一起,它更接近一个能直接接活的 Agent。

第二个值得看的是安全边界。

模型能力越强,权限越大,越不能靠“希望它别乱来”。如果 0% 的越界结果不是偶然,这项提升的实际价值可能比很多榜单分数都高。

效率也有进步。

它没有一味靠堆 token 换效果,而是在尽量减少生成量。对需要大量调用模型的团队,这会直接影响成本。

问题也不少。

先看 benchmark。

官方公布的 ARC-AGI-3 成绩达到 99.9%,几乎刷满。但这个成绩来自 OpenAI 自家的特调框架。换到独立第三方的标准测试方式后,分数回落到 62.7%。

62.7% 还是领先,只是和 99.9% 给人的感觉差得太远。

再看价格。

API 单价抬高了 2.5 倍,ChatGPT Pro 的消息限制也很紧。100 美元档每周 50 条,200 美元档每周 200 条,高频个人用户很容易不够用。

还有一点挺关键:Astra 并没有在所有“智力测试”里一起起飞。

Artificial Analysis 的 Intelligence Index 中,Astra 得分 61,与 GPT-5.6 Sol 持平,还低于 Claude Fable 5.1 的 66 分。

这基本能看出 Astra 的路子。

它不是更会“刷题”了,而是更会“把任务做完”。

谁更适合用?

如果你的工作里有大量重复操作、软件调用、代码开发、数据处理或者多步骤工作流,Astra 值得重点看。

开发者、研究人员和企业团队更容易吃到这次升级的红利。因为这类场景里,价值往往不在于多回答一道题,而在于少让人亲手做十个步骤。

预算充足、准备把 AI 接进生产流程的企业用户,也会更适合 Astra。

如果需求主要是聊天、写作、查资料,GPT-4o 或 GPT-5.6 Sol 其实已经够用。

对价格敏感,又特别看重纯推理能力的个人开发者,也没必要因为 Astra 是新模型就急着迁移。至少从现有独立测试看,它在这项能力上没有全面压过竞品。

AGI 到底来没来?

“欢迎来到 AGI 时代”,我暂时不太认同。

Astra 现在展示出来的,更像是 Agent 能力往前跨了一大步:模型开始更稳定地操作电脑、调用软件、接管复杂工作流。

但这次真正有变化的,不是哪张榜单又高了几分,而是 AI 正在从“告诉你怎么做”,变成“直接把这件事做了”。

AI 开始真正坐到电脑前干活,已经不是概念了。

评论(0)

发表评论

Advertisement 728 × 90

OpenAI 模型对比

模型 上下文 定价 API 发布 全球热度
GPT-6 Astra
1.1M $10.000 / $50.000 per 1M YES 2026-09
1.1M $10.000 / $50.000 per 1M YES 2026-09
1.1M $1.000 / $6.000 per 1M YES 2026-07
99/100
1.1M $1.000 / $6.000 per 1M YES 2026-07
98/100
1.1M $2.500 / $15.000 per 1M YES 2026-07
91/100

类似模型

关联工具

相关新闻