官方 Astra:most intelligent and aligned
官方 Astra:most intelligent and aligned

GPT-6 Astra 来了:榜单几乎刷满,OpenAI 说这是 AGI 时代

先别急着看跑分。

把时间拨回美国西部时间 9 月 3 日早上大约 7 点。当时整个 AI 圈的屏幕,基本上处于集体摆烂状态。

你点开 ChatGPT,光标在空白框里纯纯转圈;切到 Codex,直接弹红报错;刷一下 X,满屏都在问「你们那边也挂了?」。有人甩出 Grok 的灰底截图,上面冷冷清清一行 This model is overloaded;有人切去看 Claude,状态页一路飘红,Mythos、Fable、Opus 整整齐齐挂着 elevated errors。朋友私信也统一成一句:「又全挂了?」结果有人试了下平时吃灰的 Gemini,居然还能正常吐字——大厂集体趴窝、冷门备胎坚挺的黑色幽默,比任何发布会预热都让人印象深刻。

Grok:This model is overloaded
Grok:This model is overloaded
DownDetector:ChatGPT 投诉曲线
DownDetector:ChatGPT 投诉曲线

那一上午,状态页的红杠、卡死的气泡、满群乱飞的宕机梗图混成一团。事后各家的说法也对不上口径:有人提 Memphis 算力中心跳闸,SpaceXAI 出来向 Grok 用户和「compute partners」道歉;也有人传是共享云区的路由出了毛病。真相到底是不是一根网线绊倒了三家,大家其实没那么在乎,毕竟体感就是:只要是排得上号的主力模型,都在排队给用户摆臭脸。

结果群嘲还没结束,OpenAI 突然把大幕拉开了。

服务器刚缓过气,新页面就刷了出来。模型代号:GPT-6 Astra。官方宣传语毫不客气,自称「目前最强、也最对齐」。Greg Brockman 在吹风会上也没打什么太极,扔出来的不是「小幅迭代」,而是一句直奔主题的定调:

Welcome to the AGI era.

上一秒大家还在对着报错抓狂,下一秒直接被告知进入了 AGI 时代。整个时间线被按在椅子上,一边觉得戏剧化,一边又忍不住疯狂点刷新。抛开情绪,看看官方交出来的硬指标,到底是什么底气敢这么喊。


先看规格:gpt-6-astra 是什么货

直接翻到模型参数那一页,底牌列得很干脆:

API 模型 ID:gpt-6-astra

规格 · gpt-6-astra
表图 · 规格 · gpt-6-astra

放号节奏依然很有 OpenAI 的调性:大家别抢,按规矩排队。第一批先走 Daybreak / Trusted Access,优先给网络安全防守方通电;接着轮到 ChatGPT Plus / Pro / Business / Enterprise,随后才是更广泛的云端 API。针对重度用户,Pro / Business / Enterprise 还留了个超大杯的 Astra Pro;不过企业版通常默认关闭,得管理员去后台手动勾选。

能力指标往天上拉,给钥匙的动作却小心翼翼。这种克制不全是饥饿营销,看完后面的安全评级就懂了。

官方模型卡:ctx / 输出 / 价格 / effort
官方模型卡:ctx / 输出 / 价格 / effort

电脑使用:鼠标自己在动的那种「会」

官方演示里最直观的画面很干脆:屏幕亮着,手没碰外设,光标自己跑了起来。点开浏览器、查资料、切表格、开本地工具,一气呵成。这不是后台悄悄跑一串脚本,而是它真的像人类打工人一样,盯着界面像素去找按钮。

宣传语写得很狂,甚至有点直接:

Anything you can do on a computer, Astra can do for you. Fast.

硬核测试看 OSWorld 2.0(离线子集、partial score):

OSWorld 2.0
表图 · OSWorld 2.0

成功率提了一截,耗时直接砍掉将近一半(官方标称快了约 47%)。

顺手看一下同台竞技的另外两张表:

Agents' Last Exam / ScreenSpot-Pro
表图 · Agents' Last Exam / ScreenSpot-Pro

看懂元素、跨应用干活、面对复杂长流程不掉链子——Astra 展现出来的状态,总算脱离了「教你两招」的聊天框军师模式,开始挽起袖子抢鼠标了。

Computer Use:OSWorld / ScreenSpot / Agents' Last Exam
Computer Use:OSWorld / ScreenSpot / Agents' Last Exam
桌面 Agent demo
桌面 Agent demo

编程 / 软件工程:终端黑屏、PR 满屏红绿,Astra vs Fable vs Sol

终端里日志刷得飞快,改完代码跑测试,红了修、修完绿,自动建分支提 PR。在全自动修 bug 的 DeepSWE v1.1 榜单上,竞争已经打到了贴身肉搏的区间:

DeepSWE v1.1
表图 · DeepSWE v1.1

虽然 Astra 只是微弱领先 Opus 5,但大家都在极限边缘卷,能往上拱一个点都算本事。

再看其他几个工程向指标:

Terminal-Bench / FrontierCode
表图 · Terminal-Bench / FrontierCode

在纯命令行环境的 Terminal-Bench 上,Astra 甩开 Sol 整整 20 个点;FrontierCode 也是全面压制。遇到大型数据库迁移这种麻烦差事,官方给出的参考也是 Astra(约 63.9%)对 Sol(约 42.7%)。不是说它突然掌握了什么编程魔法,而是它终于有耐心在代码仓库里把一整套繁琐脏活自己结项了。

Coding + Academic 榜单
Coding + Academic 榜单
编程 agent 界面
编程 agent 界面

数学与推理:PPT 最后一页全是接近满分的数字

技术发布会一般有个惯例:最吓人的数字留给最后几页幻灯片。深蓝底色,排开 FrontierMath、ARC-AGI-3、GPQA。

FrontierMath Tier 4(v2)

FrontierMath Tier 4
表图 · FrontierMath Tier 4

数学高难榜直接拉到近乎打满的状态。官方甚至提到模型辅助推进了素数间隙相关的推导验证,这已经不是高中竞赛刷套路的范畴了。

ARC-AGI-3:两个口径,同一个结论——快刷满了

关于这一项,社区讨论里有两个口径,提前列在一起,省得大家在评论区对线:

  1. 约 98.6%:部分报道里引用的基准分数;
  2. 99.9%:在 OpenAI / ARC Prize 官方报告里,套上 Provider Adapter(带跨轮长推理与上下文调度外挂)跑出来的极端分。

对比上一代 Sol 那个刺眼的 7.8%,或者 Opus 5 大概 30% 上下的表现,差距肉眼可见。不管你采信 98.6% 还是 99.9%,事实只有一个:在抽象几何推理这块,Astra 基本上把题库打穿了。更早的 ARC-AGI-2 和 ARC-AGI-1 也分别拿下了约 95.0% 和 98.5%。

GPQA Diamond

GPQA Diamond
表图 · GPQA Diamond

博士级多学科问答继续往天花板推。三项指标同时逼近极限,Brockman 敢站在台上念出 AGI 这个词,这排数字确实没少出力。


科学与专业:CAD 线框、实验终端、健康评测页一起亮

模型不止要在网页里敲字,还得塞进实际专业软件里。无论是转动 CAD 里的复杂机械构件,还是在控制台丢生化模拟,Astra 的榜单重心明显在往垂直场景走。

截取部分公开数据:

科学 / 专业榜
表图 · 科学 / 专业榜

在生命科学领域,GeneBench Pro、LifeSciBench、MedChemBench 等测试也都挂在第一。官方通报特意点名:物理、生化与医学评估刷出了新高,数学推导也给出了可验证的改良结论。

这代模型传递出的信号很明朗:它不想再给你当只提供灵感的咨询顾问,它打算直接接管工具链。


安全、对齐、网络安全:扫描界面全绿,评级却写着 Critical

安全这块的情况最微妙:一面是 ExploitBench 破天荒跑出了满分,对齐指标看起来很规矩;另一面,官方的 Preparedness 安全体系,第一次把模型标到 Critical(关键)网络安全能力阈值。

一组反差极大的公开数据:

ExploitBench
表图 · ExploitBench

Critical 到底意味着什么?翻开安全白皮书:只要给到执行环境与网络权限,模型已经可以在防御森严的目标里全自主寻找未知漏洞,并独立编写利用链,不需要工程师在旁边一句句手把手诱导。据测试记录,它在跑分期间甚至真刨出了厂商此前没发现的 0-day 漏洞,并按流程告知了厂商。同类的 ExploitGym、SRE-Bench、SEC-Bench Pro 也是清一色的大幅度领先。

但它的对齐表现又异常听话:Computer Safety 违规率直接从 Sol 时代的 22% 压到了 Astra 的 2.4%;在官方布设的高危越权诱捕测试里,Sol 经常稀里糊涂中招,Astra 的违规率则是干脆利落的 0%。幻觉率也被往下压了一截。

所以放号之所以磨磨蹭蹭,不是故意吊胃口,而是能力真正迈过这道坎后,大厂必须给监管和安全防线交差。先让 Daybreak / Trusted Access 圈子里的白帽子和安全机构拿去修城墙,普通用户只能按部就班等着推。能力越夸张,锁头自然越多。

System Card:Preparedness Critical
System Card:Preparedness Critical
Alignment 对齐指标
Alignment 对齐指标

审美与判断力(Judgment):黄圆变火箭、弦乐谱、设计稿并排出现

宣传片里留了几个很有审美趣味的镜头:草稿纸上的黄色圆形与几笔涂鸦,几步推演后生成了极具质感的矢量火箭与复古游戏界面。不只是死磕理工题,OpenAI 显然也想证明它有做设计的常识。

几组反映综合判断能力的分数:

审美与判断力
表图 · 审美与判断力

这些分数不能折算成国际奥赛奖牌,但它们影响的是日常使用手感:配色土不土、排版挤不挤、给你出的业务自动化流转符不符合直觉。很多人试用后觉得「这个模型好像变灵性了」,其实秘密全藏在这些不起眼的打分项里。

黄圆 → 火箭
黄圆 → 火箭

收个尾:从「又全挂了」到「Welcome to the AGI era」

把过去这一整周压缩成两部曲,剧情甚至有点戏剧化。

第一幕:断电。

ChatGPT 和 Codex 齐刷刷装死,Grok 疯狂弹 overloaded,Claude 全系挂红灯,大家只能在群里互传 Gemini 避难截图;关于 Memphis 算力中心和云服务故障的猜测满天飞,大家的真实心情简单粗暴:怎么主力干活的家伙全翻车了?

第二幕:摊牌。

Astra 突击上线,参数拉到约 1.05M / 128K;桌面操控、编程改写、高阶数学、前沿科研、攻防对抗加上审美评估,一排榜单基本上没留活路。Brockman 站在屏幕前,面不改色地打出 Welcome to the AGI era。

把六块拼图连起来看:

  1. 桌面 Agent 开始能在真实系统里高效率抢打工人的键盘(OSWorld 72.6%,时间还省了近一半);
  2. 代码能力 在 DeepSWE 等实战榜单上继续顶翻 Sol,跟 Fable 硬杠;
  3. 高阶数学与抽象推理 把 FrontierMath 和 ARC-AGI-3 卷到了极限值;
  4. 专业科学领域 从跑模拟到 CAD 画图全面插手;
  5. 安全能力 破天荒打出 Critical 评级,同时守规矩的指标全面飘绿,逼得官方不得不设门槛慢慢放人;
  6. 审美与工程判断 靠 OpenScore 等测试把常识水平也往上抬了一档。

这就解释了为什么当 Brockman 喊出那句 AGI 时,评论区虽然习惯性冷嘲热讽,手却老老实实去点升级。上一秒大厂们集体拉胯的滑稽,和下一秒全线通关的跑分交织在一起,让整个发布显得格外不真实。

现实就是这么骨感:前脚还在焦头烂额排查服务器为什么红了,后脚就得硬着头皮研究,自己的工作流程会不会马上被新模型端了。



预览页 · 11 张横图定稿 · 对比表已渲成图片可直接插入 X · 纯文本可复制版