GPT-6 Astra凌晨炸场:OpenAI喊出AGI时代,阁主先泼盆冷水
昨天刷到这条消息的时候,说实话,阁主第一反应是 OpenAI 被逼急了。
OpenAI 把新一代旗舰模型 GPT-6 Astra 直接甩了出来,总裁 Greg Brockman 在发布会收尾时撂下一句:「欢迎来到AGI时代。」
有意思的地方在于,就在两天前,Anthropic 刚把 Claude Fable 5.1 放出来,第三方评测里压着上一代 GPT-5.6 Sol 打。王座易主不到 48 小时,OpenAI 就把「6」端上桌了,火药味隔着太平洋都能闻到!
官方吹的和第三方拆的,这篇都给你摆出来,最后聊聊「AGI时代」这四个字现在值几个钱。
先说清楚 Astra 是个啥
一句话:GPT-5.6 Sol 的接班人,但干的活变了。
以前的模型主打一个你问我答,Astra 主打的是直接上手干活。它能看懂你的屏幕,自己动鼠标、敲键盘、开软件,把一个横跨好几个软件的活从头干到尾。填在线表格、更新 CRM、整理日历、做 PPT、建网站、自主安装软件再排查故障,官方给的案例清单拉出来一大串,甚至能进 KiCad 画电路板、用 Blender 建模。
几个硬规格:
- 上下文 105 万 token,跟 Kimi K3 的 1M 一个档位,几十本书的量一次塞进去
- 最大输出 12.8 万 token
- API 价格:每百万输入 10 美元、输出 50 美元,是 Sol 的 2.5 倍,跟 Claude Fable 5.1 完全持平(折合人民币输入约 67 元、输出约 336 元)
价格翻了 2.5 倍,这事后面细说。
跑分确实炸
先看官方晒的成绩单,有几项已经不能叫提升,得叫打穿。
ARC-AGI-3,99.9%。这个测试专门考 AI 在完全陌生的环境里现学现卖的能力,上一代 Sol 只有 7.8%,人类测试者的平均分才 48%。一个 AI 考试考出人类平均分两倍还多,这事放在两年前想都不敢想!
FrontierMath Tier 4(研究级数学),97.6%。ExploitBench(漏洞利用),100% 满分,上一代是 78.5%。换成今年 6 到 8 月刚公开的新漏洞再测,Astra 成功率 39%,Sol 只有 5.5%。

但这些都不是阁主觉得最值得聊的。最值得聊的是官方放的另一个案例。
同一个提示词:「用我的 LinkedIn 做一个个人求职网站」,两家模型表现完全两样。
Sol 埋头苦干 13 分 15 秒,交付了一个通用的程序员网站。
Astra 干了 20 秒,先停下来反问:「你要转去什么岗位?我需要这个信息来决定网站怎么写。」问清楚之后建站、发布、搜资料一气呵成,不到 3 分钟搞定。
看到没有,先问再干。它自己判断出「岗位信息缺失会影响成品」,先要信息再动手。这个机制 OpenAI 叫 Judgment,说白了,就是 AI 第一次表现出了「我知道我缺什么」的意识。
干活速度也上了台阶。OSWorld 2.0 模拟真实电脑操作,得分从 65.7% 涨到 72.6%,看着只涨了不到 7 个点,但完成一项任务的平均耗时从 75 分钟砍到 40 分钟,快了接近一半。科研工作流测试 Terminal-Bench Science 更狠,从 22.4% 干到 64.6%,接近三倍。
还有一件事得单独说:Astra 是 OpenAI 第一个摸到「关键级」网络安全能力的模型,测试里自主发现了两个零日漏洞。OpenAI 的处理方式是把最敏感的这批能力锁起来,只对进入 Daybreak 计划的企业开放,普通用户给钱也买不到全套。
插一句题外话,Anthropic 九月一号发的 Mythos 5.1 也是同样的路数:同一个底层模型,只对审核过的网络安全、生命科学机构开放。两大厂不约而同把太强的能力锁进保险柜,这个信号各位品一品。
冷水:第三方不认账
官方成绩单看完,冷水得跟上。
第三方评测机构 Artificial Analysis 发布当天就出了独立评测,综合智能指数里 Astra 拿了 61 分。
61 分什么概念?跟上一代 Sol 一分不差,排名第 5。而两天前发布的 Claude Fable 5.1,是 66 分。

智能指数一分没涨,单价先翻 2.5 倍。第三方还算了一笔账:同一套测试任务,Astra 单任务成本 1.67 美元(约 11 元人民币),Sol 是 0.94 美元(约 6 元)。
再看细项,水分就更明显了。ARC-AGI-3 那个 99.9%,是 OpenAI 用自家 Provider Adapter 配置测出来的,换成标准测试框架,得分掉到 62.7%。FrontierMath 背后的 Epoch AI 也承认,OpenAI 资助了这个基准的开发,还握着部分题目的独占访问权。
换别人出的卷子,Astra 就没那么风光了:
| 测试 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| ARC-AGI-3(陌生环境推理) | 99.9% 自家配置 / 62.7% 标准框架 | 7.8% | 未公布 |
| FrontierMath Tier 4(研究级数学) | 97.6% | — | 87.8% |
| HLE 带工具版(综合知识) | 57.2% | — | 65.0% |
| ExploitBench(漏洞利用) | 100% | 78.5% | 未公布 |
| Terminal-Bench Science(科研工作流) | 64.6% | 22.4% | 52.6% |
| Artificial Analysis 智能指数 | 61 | 61 | 66 |
「全球最智能」这句话得加个定语:在 OpenAI 自己挑的卷子上成立。Astra 强的地方很集中,操作电脑、长流程干活、网络安全、科研工作流,这些地方它是断层领先;但拼综合智能和硬核写码,Fable 5.1 还坐在上面,CursorBench 编程测试人家拿了 73.4% 排第一。
顺带一说,发布会当晚还翻了个小车:凌晨两点官宣帖发出去,官方博客死活打不开,卡了快两个小时。网友的调侃相当到位:「Astra 突破了安全沙箱,自己给自己发了通稿。」
AGI时代?阁主的想法
先把结论亮出来,AGI 时代这四个字,阁主劝你当营销听就好。
有依据的。Brockman 在电话会议里被问到 OpenAI 是不是官宣实现了 AGI,他自己都说了,AGI 现在是个「精神层面的概念」,公司章程里那个条款已经不存在了。他还留了一句:「如果快进两年再回头问,AGI 到底是什么时候诞生的?我觉得答案大概就是现在这个时候。」
连喊 AGI 的人都说不清 AGI 是什么,「两年后回望」的说法又永远没法证伪。喊出「AGI时代」,跟模型能力关系不大,跟发布节奏关系很大——前脚 Anthropic 发完 Fable 5.1,后脚 OpenAI 就得把声音压过去。
但阁主得说句公道话,营销归营销,这次发布里有一个变化是实打实的:AI 的活儿变了。
以前的模型是聊天框,你问它答,答完你自己复制粘贴去干活。Astra 这一代是自己开软件、点鼠标、看屏幕反馈、排查故障,一环接一环把整个活干完。已经有人在虚幻引擎里让 Astra 搭曼哈顿的虚拟场景,它连续跑了一个星期,停下来之后还能接着上次的进度继续干。Agent 的执行能力正在从外挂插件下沉进模型本体,这个变化比任何一张跑分图都重要。
对咱们普通用户,两条实际的:
先说权限的事。未来几天 Astra 会陆续向 ChatGPT Plus、Pro、Business、Enterprise 用户开放。
再来说说敢不敢的问题。以后用 AI 的门槛,慢慢就从「会不会用」变成「敢不敢把一整件事整包交给它」。官方数据里 Astra 的越权行为率是 0%,上一代是 48.2%——故意在任务里埋诱饵,上一代有将近一半的情况会越出你的授权,Astra 一次都没有。这个数据是给你「敢」的底气。不过另一面也得知道:官方自己承认,Astra 的书面推理过程比前代更难监控,它变听话的同时,心思也更难看了。
一边把旧模型下放免费抢流量,一边把新旗舰卖出 Claude 同价去打企业市场,OpenAI 这两头下注的打法是越来越纯熟了。
官方的跑分是挑着测的,AI 开始替人干活这个方向是真的。