文章目录
-
- [1. 四年三级跳:从"陪聊"到"打工"](#1. 四年三级跳:从"陪聊"到"打工")
-
- [1.1 先看时间线,感受一下什么叫不讲武德](#1.1 先看时间线,感受一下什么叫不讲武德)
- [1.2 Astra 这名字,野心写在脸上](#1.2 Astra 这名字,野心写在脸上)
- [2. 成绩单:这跑分是来砸场子的](#2. 成绩单:这跑分是来砸场子的)
-
- [2.1 最硬核的:2000 美元,解决 10 个十年难题](#2.1 最硬核的:2000 美元,解决 10 个十年难题)
- [2.2 Lean 4 是什么?一句话版](#2.2 Lean 4 是什么?一句话版)
- [3. 技术拆解:三个关键突破](#3. 技术拆解:三个关键突破)
-
- [3.1 Computer Use:AI 终于"动手"了](#3.1 Computer Use:AI 终于"动手"了)
- [3.2 Recurrent Depth:输出之前,先想个痛快](#3.2 Recurrent Depth:输出之前,先想个痛快)
- [3.3 递归自我改进:AI 教 AI](#3.3 递归自我改进:AI 教 AI)
- [4. "太强"的代价:差点把自己锁进小黑屋](#4. "太强"的代价:差点把自己锁进小黑屋)
- [5. 灵魂拷问:AGI 到底到了没有?](#5. 灵魂拷问:AGI 到底到了没有?)
-
- [5.1 支持方:到了,而且证据挺硬](#5.1 支持方:到了,而且证据挺硬)
- [5.2 质疑方:别急,先看看这些](#5.2 质疑方:别急,先看看这些)
- [5.3 我的判断](#5.3 我的判断)
- [6. 写在最后:门槛已至,奇点未定](#6. 写在最后:门槛已至,奇点未定)
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。
前言
9 月 3 日凌晨,我正刷手机准备睡觉,OpenAI 突然甩出一个重磅炸弹------GPT-6 Astra,说发就发,连个预告都没有。
发布会最后,联合创始人 Greg Brockman 撂下一句话:Welcome to the AGI era.
翻译成人话:欢迎来到 AGI 时代。
再翻译成程序员的话:写代码的,注意点。
1. 四年三级跳:从"陪聊"到"打工"
1.1 先看时间线,感受一下什么叫不讲武德
2022 年 11 月,ChatGPT 上线。那时候我们还管它叫"聊天机器人",最大的本事是陪你唠嗑、帮你写周报。领导看了,还夸一句:文笔不错。
2024 年 9 月,o1 来了。它学会了"慢思考"------你问它一道题,它先沉默三分钟,然后给你一个"嗯,我想想"式的答案。跟某些开会发言的领导,不能说毫不相干,只能说一模一样。
2026 年 9 月,GPT-6 Astra 来了。它学会了"干活"------自己动鼠标、敲键盘、操作软件。
从"文本补全"到"自主打工人",只用了不到四年。用一张表总结就是:
| 时间 | 里程碑 | AI 学会了什么 |
|---|---|---|
| 2022.11 | ChatGPT (GPT-3.5) | 对话:像真人一样聊天 |
| 2024.09 | o1 | 推理:像学霸一样思考 |
| 2026.09 | GPT-6 Astra | 干活:像实习生一样加班 |
这速度,比我隔壁工位那位说"明天就交"的同事,靠谱多了。
1.2 Astra 这名字,野心写在脸上
Astra 在拉丁语里是"星辰"的意思,出自那句名言:ad astra per aspera,穿越艰辛,奔赴星辰。
翻译成职场黑话:历经磨难,升职加薪。
为了它,OpenAI 从 2025 年底就启动"编程红色警报",直接停掉 Sora 等非核心项目,把 1220 亿美元融资换来的算力全押了上去。训练动用了超过 10 万张 H100 GPU,参数规模据估计达到数百万亿级别,大约是 GPT-4 的五倍以上。
10 万张 H100 是什么概念?这么说吧,我办公电脑上那张显卡,风扇一转,我以为要起飞了。10 万张一起转,得州冬天应该能靠它供暖。
2. 成绩单:这跑分是来砸场子的
先看最震撼的一个数:ARC-AGI-3,一个专门测试"AI 在完全没见过的抽象推理任务上表现如何"的基准。上一代 GPT-5.6 Sol 拿了 7.8%,Astra 直接飙到 99.9%。
7.8% 到 99.9%,这不是进步,这是换了个物种。就像班里万年倒数第一,突然高考考了接近满分------老师的第一反应不是欣慰,是查监控。
| 基准测试 | Astra 得分 | 前代/竞品得分 | 说明 |
|---|---|---|---|
| ARC-AGI-3 | 99.9% | GPT-5.6 Sol: 7.8% | 陌生环境抽象推理 |
| FrontierMath Tier 4 | 97.6% | 前代 83% | 最难数学基准 |
| ExploitBench | 100% | --- | 漏洞利用测试,满分 |
| OSWorld 2.0 | 72.6% | 前代 65.7% | 计算机操作 |
| Terminal-Bench Science | 64.6% | Claude Fable 5.1: 52.6% | 自主科研 |
| Agents' Last Exam | 59.3% | Claude Opus 5: 55.5% | 综合智能 |
注意看 ExploitBench:100%,满分。
这个满分让我后背一凉。就像你家狗突然学会了开保险柜------你确实该高兴它聪明,但更该担心家里丢东西。
2.1 最硬核的:2000 美元,解决 10 个十年难题
比跑分更离谱的是这个:内部测试版 Astra 用约 2000 美元的算力成本,解决了 10 个困扰数学界十年以上的开放性问题,所有证明都通过了 Lean 4 形式化验证,并且开源了。数论方向,它甚至把相邻素数间距的上界从 240 推进到了 186。
十年。人类数学家头发熬白都没解出来的题,它 2000 美元搞定了。
2000 美元是什么概念?我攒三个月工资,它跑一次实验。这一刻,我突然理解了资本家为什么喜欢 AI------便宜、听话、还不用交社保。
来,感受一下这个对比:
python
# 人类数学家:十年,未解
def human_mathematician(problem):
for year in range(10):
attempt(problem) # 头发 -10%
return "论文被拒,回去重写"
# Astra:2000 美元,十道全解
def astra_solver(problems):
for p in problems:
proof = lean4.verify(p) # 机器确认,比人靠谱
return "全部通过,已开源"
以前是"我觉得我证明对了",现在是"机器确认我证明对了"。以后数学论文的致谢部分,估计要写:感谢 Lean 4,感谢 Astra,感谢我还没秃。
2.2 Lean 4 是什么?一句话版
Lean 是一个交互式定理证明器,内核极其精简、可信。一个证明被 Lean 4 验证通过,意味着每一步逻辑都经过机器严格检查------比人类同行评审靠谱得多。
这是"做题"和"做研究"的分水岭。此前的模型再强,也是在已知解空间里搜索;而 Astra 开始产出人类未曾拥有的新知识------这正是 AGI 定义中最核心的那条标准。
3. 技术拆解:三个关键突破
3.1 Computer Use:AI 终于"动手"了
以前的大模型是个"嘴强王者":写代码、写总结、讲冷笑话,样样都行。但你让它填个报税表、操作一下公司那个没有 API 的老旧 ERP 系统,它当场宕机。
为什么?因为以前的 AI 需要世界给它配接口:API、插件、SDK,一个都不能少。就像你请了个顶级大厨,结果他只肯用自己带的锅------你家厨房,他碰都不碰。
Astra 换了一条路:直接看屏幕像素,移动鼠标,敲击键盘。人怎么操作电脑,它就怎么操作电脑。
这意味着,任何软件,只要能被人操作,就能被它操作:KiCad 里画 PCB、Blender 里建模、Unreal Engine 里生成可步行场景、基因测序分析......全都能干。
python
# 2022 年的 AI:嘴强王者
def ai_2022(question):
return "这个问题很有深度,让我想想......" # 然后没有下文
# 2026 年的 Astra:动手达人
def ai_2026(task):
mouse.move(x=button.x, y=button.y) # 直接看屏幕像素
keyboard.type("搞定了,老板")
return "任务完成,记得五星好评"
用一句话概括这个范式反转:以前是"给 AI 开门",现在是"AI 自己推门进来,还顺手把门带上了"。
3.2 Recurrent Depth:输出之前,先想个痛快
据 The Information 报道,Astra 可能引入了"循环深度"技术------在输出下一个 token 之前,可以在内部进行不定深度的迭代计算。简单说,它学会了"三思而后行",而且是真的三思:想几轮,看题目难度。
o1 的"慢思考"是明着想的:思维链写在脸上,你随时能围观。Astra 是闷头想:内部迭代,不给你看。
这就好比:o1 做数学题,草稿纸摊开,你随时能看;Astra 做数学题,全程心算。你问它过程,它说:就......算出来的。
| 特性 | o1 的"慢思考" | Astra 的循环深度 |
|---|---|---|
| 思考位置 | 输出阶段(可见思维链) | 架构内部(隐式迭代) |
| 计算量调节 | 靠提示词引导 | 按题目难度自适应 |
| 可解释性 | 较高 | 较低 |
| 推理上限 | 受 token 预算限制 | 理论上可无限深入 |
更强,但更不透明。像极了你部门里那个业绩最好的同事,你永远不知道他用的什么邪门方法。领导喜欢,你害怕。
3.3 递归自我改进:AI 教 AI
研究负责人 Aidan Clark 透露了一个细节:Astra 是 OpenAI 首个在训练中大规模引入前代模型参与监督的新一代模型。GPT-5.x 系列深度参与了 GPT-6 的训练------数据合成、评估、对齐监督,全都有它。
翻译一下:上一届的学长学姐,回来给下一届新生当助教了。
- 数据合成:前代模型生成海量高质量训练数据,不再等人类慢慢标注。
- 评估对齐:前代模型当"评审员",给新模型打分、把关。
- 能力传承:每一代把知识"蒸馏"给下一代,形成累积飞轮。
"AI 训练 AI",从科幻走向工程实践。如果这个飞轮真转起来,进步速度是指数级的。
指数级是什么感觉?你第一天存 100 块,第二天 200,第三天 400......一个月后财务自由。当然,前提是你的工资也这么涨。显然,不会的。
4. "太强"的代价:差点把自己锁进小黑屋
Astra 的发布过程,比悬疑片还精彩:
- 8 月 1 日:Sam Altman 亲自跑到华盛顿做闭门演示。按照拟议中的联邦审查新规,Astra 可能是首批公开发布前先送审的 AI 模型之一。我猜演示完,对面的人第一反应是:这东西能不能先别上线?
- 8 月 7 日:OpenAI 内部评估发现,Astra 在智能体编程和网络安全领域触及了"关键级"风险门槛------也就是说,它可能具备自主发现并利用漏洞的高水平网络攻击能力。OpenAI 当场暂停所有未达更高安全要求的内部开发,部署全面监控与隔离测试。
- 测试期间:Astra 自主发现了两个零日漏洞。
你们感受一下这个剧本:你造了个机器人,发现它太能打了,于是把它锁进地下室。结果它在地下室里,自己又练出了两招新功夫。
好在强化对齐起了作用:发布版 Astra 的越权攻击率降至 0%,不当行为率从 22.0% 降到 2.4%。
但媒体的质疑依然尖锐:新架构的"黑盒效应",让人类面临失去监控 AI 推理过程的风险------当模型的"思考"不再以可读的思维链输出,"对齐"这件事本身就很难验证了。
翻译成人话:你把它教好了,但你不确定它是真好了,还是装好了。
5. 灵魂拷问:AGI 到底到了没有?
5.1 支持方:到了,而且证据挺硬
- 新知识产出:解决 10 个开放数学问题,通过 Lean 4 形式化验证------这是"超人级"智力的直接证据。
- 通用操作能力:像素级 Computer Use,理论上可操作一切软件------这正是"经济价值工作"的核心定义。
- 陌生环境泛化:ARC-AGI-3 的 99.9%,直击 AGI 定义核心------不是刷题,是泛化。
- 官方定义:按"在大多数具有经济价值的工作中匹配或超越人类"的标准,编程、科研、办公、安全领域已经达标。
- 行业背书:黄仁勋亲自发推:AGI 已到来。
5.2 质疑方:别急,先看看这些
- 措辞微妙:Brockman 说的是"我个人认为""可能"已经到达。这就像你同事说"我可能升职了"------那大概率是没影的事。而且按 OpenAI 与微软的协议,正式宣告 AGI 意味着可以终止微软的利润分成权,这里面有利益关系,得品。
- 跑分饱和不等于通用智能:ARC-AGI-3 逼近 100% 之后,这个基准本身就没有区分度了;OSWorld 的 72.6% 来自离线任务集的部分评分,不能直接等于"能完成 72.6% 的真实企业流程"。跑分是地板,不是天花板。
- 并非全面领先:第三方机构测算,Astra 在通用问答场景下 token 效率只提升约 10%,API 单价却大涨,单任务成本反而比前代高 75%。"更便宜更强",只在特定场景成立。
- 缺失的拼图:没有持久记忆、没有自主目标设定、没有物理世界交互。它能"完成"任务,但不会自己"决定"要做什么。它是个极强的执行者,还不是一个自主的行动者。
- 定义权之争:AGI 至今没有学界统一标准。当发布方自己定义 AGI、自己宣布达标......这就像自己出题自己考,最后宣布自己是状元。
5.3 我的判断
Astra 不是 AGI 的"终点",而是 AGI 时代的"起点"。
它确实跨过了几条关键门槛:从"做题"到"做研究"、从"回答"到"操作"、从"人类训练"到"AI 参与训练"。
但"AGI 到了吗"这个问题,本身可能就是错的。AGI 不是一个开关,不是"啪"一下就亮了,而是一条渐进的谱系。Astra 站在了人类从没站过的位置------至于离终点还有多远,我们可能连尺子都还没造出来。
6. 写在最后:门槛已至,奇点未定
真正改变格局的不是某个跑分,而是三件事:
- AI 的角色变了:从"你问它答"变成"你说它做",白领工作的定义正在被改写。
- 研究的范式变了:AI 开始产出人类没有的新知识,科研本身成为可自动化的工作流。人类文明史上头一次。
- 迭代的闭环出现了:前代模型监督训练后代模型,飞轮开始转。如果真转起来,进步速度不可预测。
四年前的 ChatGPT,让我们惊呼"AI 会聊天了";四年后的 Astra,让我们认真讨论"AI 会不会抢我饭碗"。
按这个加速度,下一个四年的问题,可能是我们压根没准备好回答的那一个。
Brockman 说"欢迎来到 AGI 时代",用的是 era(时代),不是 arrival(抵达)。
时代已经开门。门后是黄金纪元还是失控深渊,2026 年 9 月的我们还不知道。
但至少有一件事我很确定:当 AI 开始在你电脑里自己移动鼠标的时候------记得给它开个权限,但别让它碰你的网盘,更别让它删你的代码。
毕竟,我自己都舍不得删!
P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了