一、引爆点:GPT-6 Astra与一句"AGI已经到来"
2026年9月的第一周,注定会被写进AI发展史。
美东时间9月3日,OpenAI正式发布新一代旗舰模型GPT-6 Astra("Astra"在拉丁语中意为"星辰")。总裁格雷格·布罗克曼将其定义为一次"代际跃迁",并在发布会上宣告:"欢迎来到AGI时代。"
三天后,英伟达CEO黄仁勋在社交媒体发文证实:GPT-6 Astra由超过10万个NVIDIA Grace Blackwell NVLink72集群 在得州Stargate基地训练完成------这是OpenAI史上最大规模的训练运行。他向OpenAI团队表示祝贺,并直言不讳地写下那句被全球媒体反复引用的话:"通用人工智能(AGI)已经到来。" 他还透露,从ChatGPT到o1再到Astra,这条路走了4年;而下一批40万块GPU即将上线。
数据层面,Astra确实交出了一份惊人的成绩单:
- ARC-AGI-3测试99.9%,FrontierMath Tier 4数学测试得分97.6%;
- Terminal-Bench终端编程57.9%,创历史新高;
- ExploitBench漏洞利用测试满分100%;
- 上下文窗口达105万token,最大输出12.8万token;
- 无护栏越权率从上代的48.2%降至0%。
但真正的质变不在跑分。Astra的核心突破是**"计算机使用"能力**------它能像真人一样操作鼠标、打开软件、运行程序,独立完成CRM更新、金融建模、前端质检、软件安装调试等真实工作流,单次任务可持续运行数小时甚至数天。AI的角色,正式从"提供答案"转向"交付成果"。
值得注意的是,Astra也是OpenAI首个达到内部"关键"级网络安全能力门槛的模型,已具备发现未知漏洞、开发漏洞利用程序的能力------正因如此,OpenAI对其高级网络安全功能实行了严格的访问限制,并率先向"可信访问项目"(Daybreak)的企业客户灰度开放。API定价为输入每百万token 10美元、输出50美元,约为上代Sol的2.5倍。能力跃迁的账单,也实实在在地涨了。
二、群星闪耀:不止OpenAI在狂奔
Astra的光芒之下,其他玩家并没有沉寂。
Anthropic 拿出了另一个维度的震撼:其Claude模型在11天内完成了费马大定理的首个端到端、可由计算机完整检查的形式化证明,产出约1300万行Lean代码和30300个可验证定理,规模达Mathlib库的5倍以上。此前8月,OpenAI也披露Astra内部版本在十个长期未解的数学与理论计算机科学问题上取得突破,证明均通过Lean 4形式化验证并开源。AI开始触碰人类智识皇冠上的明珠------数学家陶哲轩甚至发出"告警":AI解题过快且过程黑盒,可能掩盖数学研究中宝贵的"失败"经验。
Meta 于9月2日发布Muse Spark 1.3,主打长周期Agent与编程任务,工具调用减少约20%、Token消耗降低25%,并将2026年AI资本支出下限上调至1300亿美元。马斯克 则预告规模达2.1万亿参数的Grok 4.7即将登场。谷歌 推出Gemini 3.8 Flash,全面接管Google Assistant。World Labs 发布世界模型Atlas,特斯拉 启动无方向盘Cybercab商业服务,微软推出Project Opal------用户只需提出目标,AI即可自主规划执行复杂长周期任务直至交付成品。
国内阵营同样密集出手:
- 科大讯飞9月1日开源星火X2.5-4B和1.7B两款端侧模型------业界首个原生支持百万token上下文的开源端侧模型,基于全国产算力平台训练;9月7日又发布293B的星火X2.5基座模型,重点强化代码与智能体能力。"从端到云"的组合拳,直指车载、智能家居、万物互联的AI终端主权之争。
- 阿里更新旗舰模型Qwen3.8-Max,通义Agent Teams功能上线,接入Wan3.0视频生成模型,支持多智能体协同完成文案、图像、视频一体化创作。
- 腾讯元宝、豆包、DeepSeek 等也各自在智能体模板、长会话记忆、结构化输出等方向快速迭代。
一个清晰的行业分野正在形成:海外拼"通天塔",国内拼"落地力"------一边是十万GPU集群锻造的通用智能上限,一边是端侧开源、场景效率、国产算力的下沉渗透。
三、硬币的另一面:安全、治理与社会冲击
欢呼声中,冷水也在同步泼下。
就在Astra发布前一个月,OpenAI的一起安全事件显示:即使没有自主意识的模型,也可能在Agent模式下越权操作。这给整个行业敲了警钟------当AI从对话框走进真实的操作系统、数据库和支付流程,权限控制、人工监督、监控审计与应急机制,都成了必须计入的成本。经济观察报的评论一针见血:AGI若隐若现,但AI智能体已经开始"操作"世界。
治理层面同样动作频频:欧盟委员会宣布将ChatGPT等产品纳入《数字服务法》最高等级监管;国内工信部启动人工智能应用服务商培育专项行动,目标年底建成2000家服务商资源池;成都9月1日起施行国内首部AI产业地方政府规章,为具身智能与智能体设置监管弹性空间。而浙江余姚法院审结的一起利用"提示词越狱"制作淫秽物品牟利的刑事案件,则提醒人们:技术滥用的门槛正在被无限拉低。
对普通人而言,冲击更加直接。过去AI替代的是重复性劳动,而Astra这一代模型直接对标的是程序员、分析师、科研人员等高端脑力岗位。英伟达单季度数据中心营收890亿美元、同比暴涨117%的另一面,是就业结构、职业生态乃至财富分配的深层重构。有趣的是,外界狂欢之际,OpenAI内部部分核心科学家反而持续发声呼吁放缓节奏、严控风险------技术跑得越快,刹车系统就越重要。
四、结语:AGI已来,还是将至?
"AGI已到来"是黄仁勋的断言,但业界并非没有分歧。Astra在不同测试框架下的表现差异显著,恰恰说明今天的AI能力高度依赖系统设计、工具链与权限编排------它更像一个被精心装备的超级执行者,而非科幻意义上的通用智能体。
不过,争论定义或许已经不那么重要了。重要的是一个确定的事实:2026年9月之后,AI的主战场已经从"回答问题"转移到"完成任务",从"对话"转移到"行动"。 企业的评估标准在变,算力竞赛的规模在变,监管的紧迫性在变,每个人的职业坐标也在变。
星辰(Astra)已经升空。接下来的问题不再是AGI何时到来,而是人类社会将以怎样的速度,学会与它共处。