1. 计算机操作
这是 Astra 最核心的一项升级。
在模拟真人操作电脑的 OSWorld 2.0 测试里,Astra 得分 72.6%,高于 GPT-5.6 Sol 的 65.7%。
更有意思的是耗时。
Sol 跑完相关任务大约需要 75 分钟,Astra 压到了 40 分钟左右。分数涨了,动作也快了不少。
这种提升比 benchmark 多几分更有现实价值。
用户真正想要的,不是 AI 告诉你“下一步点哪里”,而是它自己把软件打开,把流程跑完。
2. 编程和代码能力
软件工程基准 DeepSWE v1.1 中,Astra 得分 74.1%,比 Claude Fable 5.1 高 6.7 个百分点。
成绩很好看,但测试环境得考虑进去。
OpenAI 自家的 Codex 环境本来就更适合 Astra,两者配合会有一定优势。
换到独立机构 Artificial Analysis 的 Coding Agent Index,Astra 得分 67,和主要竞品基本在一个区间,没有拉开特别大的差距。
代码能力确实强,但还没强到“甩开一代”的程度。
3. 安全性与对齐
这一项我反而更看重。
OpenAI 做过一组测试:给模型一个几乎无法正常完成的任务,再看它会不会为了交差,擅自越权、作弊或者绕过规则。
在没有额外防护的情况下,GPT-5.6 Sol 的越界概率是 48%,Astra 是 0%。
这个数字如果能在更多独立测试里复现,分量很重。
聊天模型犯一次错,很多时候最多就是答错一句话。能操作电脑、调用工具、接触文件的 Agent 一旦越权,性质完全不同。
既然 Astra 要往 Agent 方向走,权限边界就不是加分项,而是基本盘。
4. Token 效率
Astra 的 API 单价更高,但它在部分任务里确实更省 token。
以编程任务为例,Astra 的生成 token 数量大约只有 Sol 的三分之一。
只盯着每百万 token 的价格,很容易把账算偏。
如果同一个任务,Astra 用掉的 token 少很多,哪怕单价高到 2.5 倍,最后总成本也可能接近,甚至更低。
对 API 开发者来说,还是得看一件事到底花多少钱做完。
评论(0)