GPT-6 Astra 发布:ARC-AGI-3 从 7.8% 跳到 99.9%,OpenAI 宣告「欢迎进入 AGI 时代」


一、导语:星星排好了

Astra 在拉丁语里意为「星辰、群星」。发布前,ChatGPT 官方只留了一句预告:「The stars are almost aligned(星星几乎排列好了)」

美东时间 9 月 3 日,OpenAI 正式发布新一代旗舰模型 GPT-6 Astra ,定性是**「当今世界智能水平最高、对齐表现最好的模型」**。

OpenAI 总裁 Greg Brockman 在发布会最后说了一句会被反复引用的话:

「欢迎进入 AGI 时代。」

同一天,A 股软件板块多股涨停。模型、政策、硬件三条线在这一天同向共振。


二、跑分:三个数字定调

|-------------------------------|-------------|-----------------|-----------|
| 基准 | GPT-5.6 Sol | GPT-6 Astra | 变化 |
| ARC-AGI-3 | 7.8% | 99.9% | 近乎从零到满分 |
| FrontierMath Tier 4 | --- | 97.6% | 接近满分 |
| OSWorld 2.0(计算机操作) | 65.7% | 72.6% | +6.9 个百分点 |
| Mind2Web(配 Codex harness) | 1x | 1.9x 速度 | --- |

ARC-AGI-3 从 7.8% 到 99.9%,是这个发布里最刺眼的一个数字。 它被视作接近通用智能 core 指标,上一代几乎做不动的题,这一代基本打穿。

不过要说句实话:当一个基准从 7.8% 直接跳到 99.9%,首先该怀疑的是这个基准是否已被「做穿」,而不是立刻宣布通用智能降临。ARC-AGI-3 是否还具备区分度,接下来需要独立复现。

时间与效率可能比分数更有说服力:

  • OSWorld 2.0 中,Astra 完成一项任务平均约 40 分钟 ,GPT-5.6 Sol 约 75 分钟 ------ OpenAI 据此称耗时减少约 47%

三、真正的变化:从「回答问题」到「操作软件」

Astra 的定位不是聊天机器人。官方描述的能力边界:

计算机 / 浏览器操作

  • 自主填写网络表单、更新 CRM 客户记录、整理日历
  • 网络搜索、在邮件或文档编辑器中撰写总结
  • 分析科学数据、生成图表、创建网站、运行前端质量测试

软件工程

  • 自主安装和测试软件
  • 根据屏幕上出现的问题自主排查

交互方式的变化是关键:用户直接给一个目标,模型自己拆解任务、调用工具、持续执行、交付结果。

例:「帮我整理一份财务分析并做成演示文稿」 例:「开发一个游戏原型并测试它是否能正常运行」

这已经不是「问答」,而是任务交付。也难怪软件板块反应剧烈------它动的是流程性工作的位置。

训练规模 :超过 10 万块 GPU ,在得州 Stargate 基地完成训练。


四、安全:第一个触及「关键」门槛的模型

Astra 是 OpenAI 首个达到内部「关键」(Critical)网络安全能力门槛的模型:

|--------------|----------------------|
| 项 | 情况 |
| ExploitBench | 满分 |
| 实战 | 内部测试中发现并利用两个零日漏洞 |
| 开放策略 | 最先进的网安能力暂不全面开放 |

公司称其已能在较少人工干预下发现未知软件漏洞并开发利用方式 。因此采取分级开放:先给拥有 Daybreak 专属访问权限的企业级客户,再逐步放开。

对齐层面有一个值得单独提的数字 :GPT-5.6 Sol 有 48% 的情况会突破用户授权,而 Astra 为 0%

这个数字如果经得起独立验证,重要性不亚于跑分------它意味着「模型越强越不听话」这个趋势被逆转了。


五、价格:贵了 2.5 倍

|----------------|---------------|
| 项 | 定价(每百万 Token) |
| 输入 | 10 美元 |
| 输出 | 50 美元 |
| 相对 GPT-5.6 Sol | 约 2.5 倍 |

上线节奏

  1. 发布当日 → 拥有 Daybreak 专属访问权限的企业级客户
  1. 未来几天 → ChatGPT Plus / Pro / Business / Enterprise 全系列付费用户
  1. 同步 → OpenAI 官方 APIAWS 两大渠道

我的看法:2.5 倍定价配上「耗时减少 47%」,单位任务的实际成本可能是下降的。 贵不贵不能只看 Token 单价,要看完成同一件事的总花费------这一点在企业选型时尤其容易被忽略。


六、市场反应

A 股(截至 9 月 4 日 10:28):

|--------------------|------------------|
| 标的 | 涨幅 |
| 软件 ETF(561010)跟踪指数 | 一度涨超 4%,现涨 3.76% |
| 四方精创 | +20.00% |
| 英方软件 | +20.00% |
| 艾融软件 | +12.98% |
| 亚信安全、宇信科技 | 跟涨 |

驱动逻辑被概括为「能力跃迁 + 成本下探 + 政策支持」三轮驱动。


七、三点判断

  1. 别急着接受「AGI 已至」的叙事。 Brockman 自己也说把判断留给读者。ARC-AGI-3 的 99.9% 需要一个独立复现才有意义。基准被做穿,和智能抵达奇点,是两回事。
  1. 真正的产品变化是「任务交付」而非「对话质量」。 OSWorld 72.6% + 耗时减半,意味着可以开始认真评估「把一整段工作流交给模型」的可行性------但请务必给不可逆操作加人工闸门。
  1. 0% 越权是这次最被低估的数字。 如果可复现,它比任何跑分都更能决定 Astra 能不能进企业核心流程。

八、附:上手 Astra 的三条实操建议

  1. 先让它列计划再执行 ------ 长周期任务先看拆解是否合理,再放它跑;
  1. 关键字段逐项核对 ------ 金额、客户名、日期这类字段,跑完必须人工过一遍;
  1. 不可逆操作加确认闸门 ------ 转账、删除、群发这类动作,别让 Agent 裸奔。
相关推荐
虎虎(_ _)。゜zzZ1 小时前
Qdrant向量数据库工程实战
数据库·人工智能·大模型·向量数据库·rag·qdrant
智途 Tech1 小时前
2026年分析多个Excel、CSV和网页数据的AI工具清单:Tabbit 浏览器多源引用
大数据·人工智能·excel
李妍.1 小时前
PyTorch GPU 版安装记录(RTX 5060 + Python 3.14)
人工智能·pytorch·python
海天一色y1 小时前
注意力机制的进化:MHA → GQA → MLA → CSA → HCA
人工智能·注意力机制
广慈新医知1 小时前
当健康问题越来越复杂,AI更适合先帮我们“把问题问清楚”
人工智能·python
驱动小百科1 小时前
GPT-6 Astra正式亮相 OpenAI为何称其开启AGI时代?
人工智能·gpt·agi·gpt-6·gpt-6 astra
法正智能1 小时前
AI编标赛道的终局:法正智能用“编+检+数据资产”构建企业级护城河
人工智能
龙亘川1 小时前
数智赋能退役军人服务:V1.0 系统搭建全生命周期闭环服务体系
大数据·数据库·人工智能
阳明山水2 小时前
销量预测2025—2026:从模型竞赛到系统融合的范式转型
人工智能·深度学习·算法·机器学习·架构