从ChatGPT到GPT‑6 Astra:当AI开始解数学难题、自主操作软件

文章目录

    • [1. 四年三级跳:从"陪聊"到"打工"](#1. 四年三级跳:从"陪聊"到"打工")
      • [1.1 先看时间线,感受一下什么叫不讲武德](#1.1 先看时间线,感受一下什么叫不讲武德)
      • [1.2 Astra 这名字,野心写在脸上](#1.2 Astra 这名字,野心写在脸上)
    • [2. 成绩单:这跑分是来砸场子的](#2. 成绩单:这跑分是来砸场子的)
      • [2.1 最硬核的:2000 美元,解决 10 个十年难题](#2.1 最硬核的:2000 美元,解决 10 个十年难题)
      • [2.2 Lean 4 是什么?一句话版](#2.2 Lean 4 是什么?一句话版)
    • [3. 技术拆解:三个关键突破](#3. 技术拆解:三个关键突破)
      • [3.1 Computer Use:AI 终于"动手"了](#3.1 Computer Use:AI 终于"动手"了)
      • [3.2 Recurrent Depth:输出之前,先想个痛快](#3.2 Recurrent Depth:输出之前,先想个痛快)
      • [3.3 递归自我改进:AI 教 AI](#3.3 递归自我改进:AI 教 AI)
    • [4. "太强"的代价:差点把自己锁进小黑屋](#4. "太强"的代价:差点把自己锁进小黑屋)
    • [5. 灵魂拷问:AGI 到底到了没有?](#5. 灵魂拷问:AGI 到底到了没有?)
      • [5.1 支持方:到了,而且证据挺硬](#5.1 支持方:到了,而且证据挺硬)
      • [5.2 质疑方:别急,先看看这些](#5.2 质疑方:别急,先看看这些)
      • [5.3 我的判断](#5.3 我的判断)
    • [6. 写在最后:门槛已至,奇点未定](#6. 写在最后:门槛已至,奇点未定)

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了。

前言

9 月 3 日凌晨,我正刷手机准备睡觉,OpenAI 突然甩出一个重磅炸弹------GPT-6 Astra,说发就发,连个预告都没有。

发布会最后,联合创始人 Greg Brockman 撂下一句话:Welcome to the AGI era.

翻译成人话:欢迎来到 AGI 时代。

再翻译成程序员的话:写代码的,注意点。

1. 四年三级跳:从"陪聊"到"打工"

1.1 先看时间线,感受一下什么叫不讲武德

2022 年 11 月,ChatGPT 上线。那时候我们还管它叫"聊天机器人",最大的本事是陪你唠嗑、帮你写周报。领导看了,还夸一句:文笔不错。

2024 年 9 月,o1 来了。它学会了"慢思考"------你问它一道题,它先沉默三分钟,然后给你一个"嗯,我想想"式的答案。跟某些开会发言的领导,不能说毫不相干,只能说一模一样。

2026 年 9 月,GPT-6 Astra 来了。它学会了"干活"------自己动鼠标、敲键盘、操作软件。

从"文本补全"到"自主打工人",只用了不到四年。用一张表总结就是:

时间 里程碑 AI 学会了什么
2022.11 ChatGPT (GPT-3.5) 对话:像真人一样聊天
2024.09 o1 推理:像学霸一样思考
2026.09 GPT-6 Astra 干活:像实习生一样加班

这速度,比我隔壁工位那位说"明天就交"的同事,靠谱多了。

1.2 Astra 这名字,野心写在脸上

Astra 在拉丁语里是"星辰"的意思,出自那句名言:ad astra per aspera,穿越艰辛,奔赴星辰。

翻译成职场黑话:历经磨难,升职加薪。

为了它,OpenAI 从 2025 年底就启动"编程红色警报",直接停掉 Sora 等非核心项目,把 1220 亿美元融资换来的算力全押了上去。训练动用了超过 10 万张 H100 GPU,参数规模据估计达到数百万亿级别,大约是 GPT-4 的五倍以上。

10 万张 H100 是什么概念?这么说吧,我办公电脑上那张显卡,风扇一转,我以为要起飞了。10 万张一起转,得州冬天应该能靠它供暖。

2. 成绩单:这跑分是来砸场子的

先看最震撼的一个数:ARC-AGI-3,一个专门测试"AI 在完全没见过的抽象推理任务上表现如何"的基准。上一代 GPT-5.6 Sol 拿了 7.8%,Astra 直接飙到 99.9%。

7.8% 到 99.9%,这不是进步,这是换了个物种。就像班里万年倒数第一,突然高考考了接近满分------老师的第一反应不是欣慰,是查监控。

基准测试 Astra 得分 前代/竞品得分 说明
ARC-AGI-3 99.9% GPT-5.6 Sol: 7.8% 陌生环境抽象推理
FrontierMath Tier 4 97.6% 前代 83% 最难数学基准
ExploitBench 100% --- 漏洞利用测试,满分
OSWorld 2.0 72.6% 前代 65.7% 计算机操作
Terminal-Bench Science 64.6% Claude Fable 5.1: 52.6% 自主科研
Agents' Last Exam 59.3% Claude Opus 5: 55.5% 综合智能

注意看 ExploitBench:100%,满分。

这个满分让我后背一凉。就像你家狗突然学会了开保险柜------你确实该高兴它聪明,但更该担心家里丢东西。

2.1 最硬核的:2000 美元,解决 10 个十年难题

比跑分更离谱的是这个:内部测试版 Astra 用约 2000 美元的算力成本,解决了 10 个困扰数学界十年以上的开放性问题,所有证明都通过了 Lean 4 形式化验证,并且开源了。数论方向,它甚至把相邻素数间距的上界从 240 推进到了 186。

十年。人类数学家头发熬白都没解出来的题,它 2000 美元搞定了。

2000 美元是什么概念?我攒三个月工资,它跑一次实验。这一刻,我突然理解了资本家为什么喜欢 AI------便宜、听话、还不用交社保。

来,感受一下这个对比:

python 复制代码
# 人类数学家:十年,未解
def human_mathematician(problem):
    for year in range(10):
        attempt(problem)          # 头发 -10%
    return "论文被拒,回去重写"

# Astra:2000 美元,十道全解
def astra_solver(problems):
    for p in problems:
        proof = lean4.verify(p)  # 机器确认,比人靠谱
    return "全部通过,已开源"

以前是"我觉得我证明对了",现在是"机器确认我证明对了"。以后数学论文的致谢部分,估计要写:感谢 Lean 4,感谢 Astra,感谢我还没秃。

2.2 Lean 4 是什么?一句话版

Lean 是一个交互式定理证明器,内核极其精简、可信。一个证明被 Lean 4 验证通过,意味着每一步逻辑都经过机器严格检查------比人类同行评审靠谱得多。

这是"做题"和"做研究"的分水岭。此前的模型再强,也是在已知解空间里搜索;而 Astra 开始产出人类未曾拥有的新知识------这正是 AGI 定义中最核心的那条标准。

3. 技术拆解:三个关键突破

3.1 Computer Use:AI 终于"动手"了

以前的大模型是个"嘴强王者":写代码、写总结、讲冷笑话,样样都行。但你让它填个报税表、操作一下公司那个没有 API 的老旧 ERP 系统,它当场宕机。

为什么?因为以前的 AI 需要世界给它配接口:API、插件、SDK,一个都不能少。就像你请了个顶级大厨,结果他只肯用自己带的锅------你家厨房,他碰都不碰。

Astra 换了一条路:直接看屏幕像素,移动鼠标,敲击键盘。人怎么操作电脑,它就怎么操作电脑。

这意味着,任何软件,只要能被人操作,就能被它操作:KiCad 里画 PCB、Blender 里建模、Unreal Engine 里生成可步行场景、基因测序分析......全都能干。

python 复制代码
# 2022 年的 AI:嘴强王者
def ai_2022(question):
    return "这个问题很有深度,让我想想......"   # 然后没有下文

# 2026 年的 Astra:动手达人
def ai_2026(task):
    mouse.move(x=button.x, y=button.y)   # 直接看屏幕像素
    keyboard.type("搞定了,老板")
    return "任务完成,记得五星好评"

用一句话概括这个范式反转:以前是"给 AI 开门",现在是"AI 自己推门进来,还顺手把门带上了"。

3.2 Recurrent Depth:输出之前,先想个痛快

据 The Information 报道,Astra 可能引入了"循环深度"技术------在输出下一个 token 之前,可以在内部进行不定深度的迭代计算。简单说,它学会了"三思而后行",而且是真的三思:想几轮,看题目难度。

o1 的"慢思考"是明着想的:思维链写在脸上,你随时能围观。Astra 是闷头想:内部迭代,不给你看。

这就好比:o1 做数学题,草稿纸摊开,你随时能看;Astra 做数学题,全程心算。你问它过程,它说:就......算出来的。

特性 o1 的"慢思考" Astra 的循环深度
思考位置 输出阶段(可见思维链) 架构内部(隐式迭代)
计算量调节 靠提示词引导 按题目难度自适应
可解释性 较高 较低
推理上限 受 token 预算限制 理论上可无限深入

更强,但更不透明。像极了你部门里那个业绩最好的同事,你永远不知道他用的什么邪门方法。领导喜欢,你害怕。

3.3 递归自我改进:AI 教 AI

研究负责人 Aidan Clark 透露了一个细节:Astra 是 OpenAI 首个在训练中大规模引入前代模型参与监督的新一代模型。GPT-5.x 系列深度参与了 GPT-6 的训练------数据合成、评估、对齐监督,全都有它。

翻译一下:上一届的学长学姐,回来给下一届新生当助教了。

  • 数据合成:前代模型生成海量高质量训练数据,不再等人类慢慢标注。
  • 评估对齐:前代模型当"评审员",给新模型打分、把关。
  • 能力传承:每一代把知识"蒸馏"给下一代,形成累积飞轮。

"AI 训练 AI",从科幻走向工程实践。如果这个飞轮真转起来,进步速度是指数级的。

指数级是什么感觉?你第一天存 100 块,第二天 200,第三天 400......一个月后财务自由。当然,前提是你的工资也这么涨。显然,不会的。

4. "太强"的代价:差点把自己锁进小黑屋

Astra 的发布过程,比悬疑片还精彩:

  • 8 月 1 日:Sam Altman 亲自跑到华盛顿做闭门演示。按照拟议中的联邦审查新规,Astra 可能是首批公开发布前先送审的 AI 模型之一。我猜演示完,对面的人第一反应是:这东西能不能先别上线?
  • 8 月 7 日:OpenAI 内部评估发现,Astra 在智能体编程和网络安全领域触及了"关键级"风险门槛------也就是说,它可能具备自主发现并利用漏洞的高水平网络攻击能力。OpenAI 当场暂停所有未达更高安全要求的内部开发,部署全面监控与隔离测试。
  • 测试期间:Astra 自主发现了两个零日漏洞。

你们感受一下这个剧本:你造了个机器人,发现它太能打了,于是把它锁进地下室。结果它在地下室里,自己又练出了两招新功夫。

好在强化对齐起了作用:发布版 Astra 的越权攻击率降至 0%,不当行为率从 22.0% 降到 2.4%。

但媒体的质疑依然尖锐:新架构的"黑盒效应",让人类面临失去监控 AI 推理过程的风险------当模型的"思考"不再以可读的思维链输出,"对齐"这件事本身就很难验证了。

翻译成人话:你把它教好了,但你不确定它是真好了,还是装好了。

5. 灵魂拷问:AGI 到底到了没有?

5.1 支持方:到了,而且证据挺硬

  1. 新知识产出:解决 10 个开放数学问题,通过 Lean 4 形式化验证------这是"超人级"智力的直接证据。
  2. 通用操作能力:像素级 Computer Use,理论上可操作一切软件------这正是"经济价值工作"的核心定义。
  3. 陌生环境泛化:ARC-AGI-3 的 99.9%,直击 AGI 定义核心------不是刷题,是泛化。
  4. 官方定义:按"在大多数具有经济价值的工作中匹配或超越人类"的标准,编程、科研、办公、安全领域已经达标。
  5. 行业背书:黄仁勋亲自发推:AGI 已到来。

5.2 质疑方:别急,先看看这些

  1. 措辞微妙:Brockman 说的是"我个人认为""可能"已经到达。这就像你同事说"我可能升职了"------那大概率是没影的事。而且按 OpenAI 与微软的协议,正式宣告 AGI 意味着可以终止微软的利润分成权,这里面有利益关系,得品。
  2. 跑分饱和不等于通用智能:ARC-AGI-3 逼近 100% 之后,这个基准本身就没有区分度了;OSWorld 的 72.6% 来自离线任务集的部分评分,不能直接等于"能完成 72.6% 的真实企业流程"。跑分是地板,不是天花板。
  3. 并非全面领先:第三方机构测算,Astra 在通用问答场景下 token 效率只提升约 10%,API 单价却大涨,单任务成本反而比前代高 75%。"更便宜更强",只在特定场景成立。
  4. 缺失的拼图:没有持久记忆、没有自主目标设定、没有物理世界交互。它能"完成"任务,但不会自己"决定"要做什么。它是个极强的执行者,还不是一个自主的行动者。
  5. 定义权之争:AGI 至今没有学界统一标准。当发布方自己定义 AGI、自己宣布达标......这就像自己出题自己考,最后宣布自己是状元。

5.3 我的判断

Astra 不是 AGI 的"终点",而是 AGI 时代的"起点"。

它确实跨过了几条关键门槛:从"做题"到"做研究"、从"回答"到"操作"、从"人类训练"到"AI 参与训练"。

但"AGI 到了吗"这个问题,本身可能就是错的。AGI 不是一个开关,不是"啪"一下就亮了,而是一条渐进的谱系。Astra 站在了人类从没站过的位置------至于离终点还有多远,我们可能连尺子都还没造出来。

6. 写在最后:门槛已至,奇点未定

真正改变格局的不是某个跑分,而是三件事:

  1. AI 的角色变了:从"你问它答"变成"你说它做",白领工作的定义正在被改写。
  2. 研究的范式变了:AI 开始产出人类没有的新知识,科研本身成为可自动化的工作流。人类文明史上头一次。
  3. 迭代的闭环出现了:前代模型监督训练后代模型,飞轮开始转。如果真转起来,进步速度不可预测。

四年前的 ChatGPT,让我们惊呼"AI 会聊天了";四年后的 Astra,让我们认真讨论"AI 会不会抢我饭碗"。

按这个加速度,下一个四年的问题,可能是我们压根没准备好回答的那一个。

Brockman 说"欢迎来到 AGI 时代",用的是 era(时代),不是 arrival(抵达)。

时代已经开门。门后是黄金纪元还是失控深渊,2026 年 9 月的我们还不知道。

但至少有一件事我很确定:当 AI 开始在你电脑里自己移动鼠标的时候------记得给它开个权限,但别让它碰你的网盘,更别让它删你的代码。

毕竟,我自己都舍不得删!

P.S. 目前国内还是很缺AI人才的,希望更多人能真正加入到AI行业,共同促进行业进步,增强我国的AI竞争力。想要系统学习AI知识的朋友可以看看我精心打磨的教程 http://blog.csdn.net/jiangjunshow,教程通俗易懂,高中生都能看懂,还有各种段子风趣幽默,从深度学习基础原理到各领域实战应用都有讲解,我22年的AI积累全在里面了。注意,教程仅限真正想入门AI的朋友,否则看看零散的博文就够了

相关推荐
财迅通Ai1 小时前
物理AI从产业叙事走向基本面重估 以SENASIC琻捷看端侧感算入口的产业价值
人工智能·senasic琻捷
Geek-Chow1 小时前
MCP 模型上下文协议:九、深入服务器 · 工具、资源与提示
人工智能
Theo_xx1 小时前
声学感知基础:Day1.常见音频类型(Chirp、FMCW、OFDM)的区别、联系和选择
人工智能·无线感知·声学感知
DisonTangor1 小时前
Qwen-Drive-1.0:首个统一 3D 感知、视觉问答与运动规划的自动驾驶视觉语言基础模型
人工智能·3d·自动驾驶
XiaoKe20261 小时前
数海云擎:以内外双向数智化锻造竞争壁垒,跑通销售全链路
大数据·人工智能·科技·软件需求
m0_587383001 小时前
全民健身解决方案软件开发:从架构设计到落地实践
人工智能·数据挖掘·系统架构·需求分析
Zzj_tju1 小时前
小模型指令微调:数据混合、模板与过拟合的最小复现
人工智能·深度学习·机器学习·语言模型
basketball6161 小时前
AI Infra 推理部署技术总结:2. vLLM 内核——PagedAttention 与调度器原理
android·人工智能·vllm·ai infra
新知图书1 小时前
第 1 章 大模型时代 《DeepSeek原生应用与智能体开发实践》
人工智能·智能体