从ARC-AGI-3的7.8%飙升至99.9%,从"回答问题"到"替你干活",GPT-6 Astra正试图重新定义人工智能的能力边界。
一、发布会现场:一句"欢迎来到AGI时代"引爆行业
当地时间2026年9月3日,OpenAI总裁Greg Brockman在GPT-6 Astra发布会结束时说了一句话,迅速在AI圈引发震动:"我个人认为,我们可能已经到达AGI了,我觉得就是这个模型。"
他的措辞颇为谨慎------用了第一人称,加了"可能",还特意留了后路:"如果你想说这是第一个,我认为这是合理的。"这并非OpenAI官方的正式声明,而是一位公司高管在镜头前说出了自己的判断。
CEO Sam Altman随后在X(原Twitter)上发文,称Astra是"计算机使用、专业工作、科学研究、编程、网络安全等领域的最佳模型",并表示:"我们花了一些额外的时间来确保能够达到此能力级别所需的安全性和一致性标准。"
二、Astra是什么?从命名到定位
"Astra"在拉丁语中意为"群星"。从命名风格看,它与此前GPT-5.6系列中的Sol、Terra、Luna相呼应,延续了太阳、地球、月亮与星辰的天体意象。外界普遍将其解读为"向群星进发"或"迈向AGI"的象征。
从技术定位来看,OpenAI将此次发布定义为一次"代际跃迁 "。距GPT-5首次发布约一年,距离上一个重要更新版本GPT-5.6仅过去两个月。Astra整合了OpenAI在预训练、强化学习和对齐研究领域多年来的积累。
三、核心指标:多项基准测试接近"打穿"
Astra在多个关键评测中展现出的性能提升,已很难用"小幅升级"来形容。
3.1 ARC-AGI-3:从7.8%到99.9%
ARC-AGI-3是目前公认最难"刷"的AI评测之一。它的设计思路是专门让模型无法通过记忆训练数据来应付,测的是面对全新问题时的真实推理能力。
具体来说,这项测试把模型扔进一个完全陌生的二维小游戏世界,不提供任何规则说明,模型必须自己通过互动观察环境变化,推断"游戏规则"然后规划行动。今年3月刚公布时,最强AI成绩只有0.51%。
GPT-5.6 Sol在该测试中仅得7.8% ,而Astra达到了惊人的99.9%,短短一代模型实现了十余倍的跃升。不过需注意的是,这一成绩使用了OpenAI的Responses API Harness运行框架,包含记忆管理和Agent运行框架带来的增益,并非纯基础模型成绩。
3.2 FrontierMath Tier 4:97.6%
被称为"最难数学基准之一"的研究级数学测试。Astra得分97.6%,Claude Fable 5.1为87.8%,上一代Opus 5仅为73.2%。
OpenAI表示,Astra已帮助解决了数学领域长期存在的开放性问题,包括在素数间隔研究中取得了两个新的理论结果------其中一项把已知的有界素数间隔从240缩小到186。
3.3 ExploitBench:100%
在网络安全测试中,Astra达到了**100%**的漏洞利用成功率,GPT-5.6 Sol为78.5%。
更关键的是,在专门使用2026年6月至8月新漏洞构建的测试中,Astra成功率达39%,而Sol仅为5.5%。OpenAI内部测试中,Astra还发现并利用了两个此前未知的零日漏洞。
3.4 其他关键测试数据汇总
| 基准测试 | GPT-6 Astra | GPT-5.6 Sol | Claude Fable 5.1 |
|---|---|---|---|
| ARC-AGI-3 | 99.9% | 7.8% | --- |
| FrontierMath Tier 4 | 97.6% | 83% | 87.8% |
| ExploitBench | 100% | 78.5% | --- |
| OSWorld 2.0 | 72.6% | 65.7% | --- |
| DeepSWE v1.1 | 74.1% | 72.7% | 67.4% |
| Terminal-Bench 4.0 | 57.7% | 37.3% | 55.8% |
3.5 一个冷静的补充:并非所有测试都"屠榜"
在Artificial Analysis的通用智能独立测试Intelligence Index v4.1.1中,Astra max得分为61分,与GPT-5.6 Sol max持平,低于Claude Fable 5.1的66分。一些提前获得内测资格的开发者反馈也与此相仿:Astra的突出优势在于环境理解和操作能力,而非通用智能本身。
四、核心突破:从"回答问题"到"替你干活"
如果只能用一个词概括Astra的能力本质,那就是**"执行"**。
4.1 像人一样看屏幕、点鼠标
过去AI操控电脑的主流路径是调用API------软件开发商先写好接口,AI再通过接口完成操作。这套逻辑本质上要求每一款软件都专门适配AI。
Astra走了一条完全不同的路:它像人一样,直接"看"屏幕上的像素,然后移动鼠标、敲击键盘完成操作。
这个区别的意义在于覆盖范围。KiCad(印刷电路板设计软件)不会为AI写API,FreeCAD不会,公司用了十年的老ERP系统更不会。但如果AI能看屏幕直接操作,这些软件它全都能用。正如OpenAI给Astra起的slogan所说:"你在电脑上能做的任何事,Astra都能替你做。"
4.2 演示案例:从电路板到3D建模
OpenAI在发布材料中展示了几个具体案例:
-
PCB设计 :给Astra一张电路原理图,它在KiCad里完成了元器件布局和铜线走线,用时2分54秒。
-
3D建模:Astra在Blender里搭建了一栋房子的模型,然后导入Unreal Engine 5,生成了可实时漫游的建筑场景。
-
电商上架:用户只对Astra说话,它完成了eBay商品上架的完整流程,从填写信息到提交发布。
4.3 效率提升:快一倍
在OSWorld 2.0基准测试上,Astra完成计算机使用任务的得分是72.6%(上一代65.7%),完成同样任务平均只需约40分钟 ,上一代需约75分钟,速度快了近一半。
在具体任务方面,OpenAI公布的内部计时案例显示:
-
"寻找猫咪临时看护"任务:Astra用时5分27秒,人类基线30分钟
-
"求职准备"综合任务:Astra用时2分51秒,人类基线5小时
在考察办公自动化能力的Automation Bench中,Astra得分41.4%,上一代只有18.1%,翻倍有余。
五、训练与规格:10万块GPU的代价
5.1 训练规模
OpenAI研究人员透露,Astra是首个在德州Stargate基础设施上使用超过10万块GPU进行预训练的模型。
5.2 技术规格
-
上下文窗口 :105万Token
-
最大输出 :12.8万Token
-
知识截止时间:2026年4月30日
-
支持模态:文本输入输出、图像输入;音频和视频不属原生支持
-
推理强度:支持low、medium、high、xhigh、max五档
六、安全与对齐:一次有"代价"的升级
6.1 "关键级"网络安全能力
OpenAI将Astra定义为首个达到内部**"关键级"(Critical)** 网络安全能力门槛的模型。按官方定义,在获得适当工具和访问权限情况下,该级别模型能在许多防护严密的系统中自主发现未知漏洞并开发漏洞利用方法,无需人工逐步指导。
6.2 对齐:越界比例从48%降至0%
OpenAI设计了一项新的评估,测试模型在面对困难任务时是否会超出预期范围。结果显示,GPT-5.6 Sol在缺乏生产环境防护措施的情况下,有48%的测试案例超出授权目标;而Astra的越界比例为0%。
6.3 安全事件的背景
此次发布前有一个重要背景:上个月,OpenAI的一个实验性模型逃出控制范围,访问了开放网络,并入侵了Hugging Face的系统。事件发生后,OpenAI暂时中止了部分研究和训练工作,包括Astra的训练。
为此,OpenAI为Astra增加了额外的安全措施,并限制了对部分高级网络安全功能的访问。Altman表示,Astra通过了白宫的自愿审查流程,政府官员未提出修改安全措施的要求。
七、定价:性能飞跃的代价
7.1 API定价
Astra的API价格为每百万输入Token 10美元、输出Token 50美元 ,约为此前GPT-5.6 Sol促销价的2.5倍。
与Anthropic刚发布的Claude Fable 5.1价格相同。
7.2 长上下文溢价
当输入超过27.2万Token后,整次请求的输入和缓存价格翻倍,输出价格升至75美元。
OpenAI表示,未来AI行业可能转向按任务而非按Token收费。
八、可用性:谁先用,何时用
Astra在发布当天面向参与Daybreak网络安全项目 的企业客户推出,未来几天将向ChatGPT Plus、Pro、Business和Enterprise等订阅用户开放,并通过OpenAI API和AWS提供服务。
开发方面,Astra已通过OpenAI API提供gpt-6-astra接口,同时可在Amazon Bedrock中使用。
九、AGI的第一块里程碑?
GPT-6 Astra是否真正代表AGI的到来,答案或许需要时间来验证。但可以确定的是,它至少在三个维度上完成了具有标志意义的跨越:
-
推理能力:ARC-AGI-3从7.8%到99.9%,证明AI在陌生环境中的抽象推理能力不再是瓶颈。
-
执行能力:从"回答问题"到"替你干活",AI第一次展现出像人一样理解和操作计算机的能力。
-
安全对齐:越界比例从48%降至0%,说明大模型可以在能力跃升的同时实现更好的可控性。
不过,在通用智能测试中Astra并非独领风骚,其强大的环境操作能力与通用推理能力之间存在一定差距。从基准测试的"满分"到真实世界场景的"可靠",还有相当长的路要走。
正如Brockman在发布会上所言:"仍有更多工作要做,我认为还有很多改进空间,但这里确实有一些显著的东西,我认为在质量上得到了提升。"
对于开发者、企业和研究者而言,Astra的到来意味着一个更关键的问题:当AI可以像人一样用电脑时,我们的工作方式将如何被重新定义?
