AGI 时代终于来了!

兄弟们,朋友们,家人们,激动的心,颤抖的手。

给大家说个大事,AGI(通用人工智能)时代终于来了。

这句话不是我说的,是 OpenAI 联合创始人兼总裁 Greg Brockman,在昨天的 GPT-6-Astra 闭门发布会上讲的,原话是:欢迎来到 AGI 时代。

昨晚一夜没睡,因为 OpenAI 早就透露过,他们下一代模型很牛逼,昨晚就得知今天会发布新模型,所以通宵守着看下它到底有多牛逼。

咱们直接说正事。

1. 新模型叫 GPT-6-Astra

上一代模型我们都知道,版本号是 5.6,新模型直接升级了大版本叫 GPT-6-Astra。

还记得上一代版本命名么?

分别是 Sol(太阳),Terra(地球),Luna(月亮),这次代号是 Astra(星辰)。

我只能说,OpenAI 终于学会了 Anthropic 取名字的小心思了,再也不是工程师风格的纯数字代号了。

2. 发布之前发生了什么?

给大家简单说下,这才刚进入 9 月,本周发生了什么。

周二,Anthropic 发布了 Fable 5.1。 周三,Google 发布了 Gemini 3.8 Flash,Meta 发布了 Muse Spark 1.3。 周四,OpenAI 发布了至今最强模型 GPT-6-Astra。

看这个节奏就能感受到:老美那边 AI 也卷得不行,表面没有波澜,其实都各种明争暗斗,真实的商战就是如此朴实无华。

还有,昨晚 Claude,Codex,Grok 基本都瘫痪了,现在都猜测是因为 Astra 的发布引起的,但官方没有定论,很快恢复了。

这里说个题外话,在瘫痪时间段,我看到一张网传截图,有人问站长,为啥我们的中转站还可以用?站长回复说,本地部署的 GPT。这个我真的笑死了,基本是不打自招了。

这类中转站就是挂羊头卖狗肉,你以为一直用的是 GPT,其实背后一直给你用的各种第三方低质或者免费模型。

3. 看下强大的榜单

这是官方公布的评测榜单:

给大家解释下各维度代表什么:

Terminal-Bench Science 0.1 科学工作流 全程在命令行里干科研活,装环境,跑脚本,处理数据,不许点鼠标。

AutomationBench 商业工作流: 自动化办公实操,填表,改 CRM,整理日程这类真实白领工作。

FrontierMath Tier 4 v2,研究级数学 职业数学家出的难题最高难度档,GPT-4 那个年代做对不到 2%。现在三家都过了 80%,Astra 97.6% 接近通关。

Terminal-Bench 4.0,电脑终端任务 第一行的通用版,不只科研场景,各种终端操作都考。

HealthBench Professional,临床任务 医疗问答,由医生按评分细则打分,length-adjusted 的意思是剔除了「答得长占便宜」的因素。

BenchCAD,3D 建模 操作 CAD 软件做工程建模,画零件,画电路板结构。

可以说每一项不仅都比上一代大幅提升,而且都全线超越了 Fable 5.1。

然后是重头戏,单独说。

ARC-AGI-3,全新交互谜题

这个维度是目前 AI 领域里一个非常前沿、难度极高的基准测试。

如果用最通俗的话来解释,它就像是把 AI 扔进一个完全没玩过、且没有任何说明书的交互环境里,看它能不能自己把规则猜出来并通关。

过去的 AI 考试拼的是「死记硬背」和「刷题经验」。只要训练数据里有类似的内容,大模型就能靠强大的记忆和模仿力拿高分。

但 ARC-AGI-3 彻底打破了这种规则,它有三大特点:没有说明书,不告诉 AI 目标是什么,也不告诉它按哪个键会发生什么。

AI 在这类考试环境里,只能像人类一样,自己去点一点、试一试,靠自己的理解和记忆去过关,这项测试不仅看 AI 能不能通关,还会看它过关的效率。

上一代 GPT-5.6 Sol 也就 7.8% 而已,这次直接干到了 99.9%,你没看错。网上流传的旧版截图写的还是 98.6%,官方页最终定稿放出来的就是这个数据。

X 上所有人看到这个数据的反应都是:What The Fuck!

所以 OpenAI 才会说出那句话,欢迎来到 AGI 时代。

这张对比图之外,官方完整榜单里还有一行更猛的:ExploitBench,网络安全攻防测试,Astra 拿了 100% 满分,上一代 Sol 是 78.5%。

啥意思呢,给它工具和权限,它能自己找漏洞,写攻击链,在加固过的系统上打穿防线,测试过程里还真挖出两个没人知道的 0day,已经提交给软件厂商了。

所以 OpenAI 把它定为自家第一个触及「关键网络风险」阈值的模型,高级网安能力只开放给经过审核的防御方。

可以说,这次 Astra 可以说全线超越 Fable 5.1,这是 OpenAI 在 Agent 时代第一次真正意义上领先 Anthropic。

4. 官方宣传视频

官方放出了一段视频,视频里演示了一个电脑,一个投屏,全程纯靠语音操作电脑,来完成各种任务,甚至还演示了用 AI 做一个 3D 设计然后直接用 3D 打印出来。

我把原视频下载下来了,感兴趣的可以看下。

5. 补充一些官方信息

  • GPT-6-Astra 训练规模是至今以来最大的一次。参数官方没公布,爆料口径是 10 万亿。官方原话是第一次在自家 Stargate 基础设施上用了超过 10 万 DBU 预训练。而且第一次让上一代模型大规模参与监督训练下一代。

  • GPT-6-Astra 的价格跟 Fable 5.1 差不多,但是在 token 利用效率上很大提升,你可以理解为,单任务干的更快更好,而且消耗 token 更少。

  • 目前是只开放了部分企业或受限组织,之后几天会逐步给 Plus、Pro 这些普通用户开放。而且掌握 Codex 重置按钮的「赛博义父」 Tibo 在 X 上承诺,全量订阅额度都可以用。相比较之下 Claude 只允许你用订阅额度的 50% Fable。

  • Codex 也跟着升级了个实用功能:上下文窗口写满后,Astra 不再靠压缩摘要硬塞,而是跨窗口记笔记,之前聊过的需求和测试结果随时能搜回来。

6. 总结

总之一句话,GPT-6-Astra 就是当下最强模型,你能在电脑上干的任何事,日常办公自动化,软件工程,科学发现,数学,工程与硬件设计,网络安全防御等等场景,它都能替你干,而且干的更快更好。

关键更恐怖的是,还有爆料说,OpenAI 年底还有一个代号 Doug 的更强模型没发布呢。

GPT-6-Astra 如果真如官方说的如此之强,那未发布的不敢想象到什么程度。

还有,当下公认最强图片生成模型 GPT-Image-2.0,这次也泄露了新版本 GPT-Image-2.5,不出意外,应该很快也会发布。

现在回想下,三个月前是什么场景,再看现在 AI 的发展真的是一天一变。

对于大家来说,就两件忠实的建议,一全面拥抱 AI,二想办法用上 Codex。

不管 GPT-6-Astra 是不是真的如官方所说,代表着 AGI 时代的到来,但随着模型能力越来越强,AI 训练 AI 效率是越来越高的,AGI 时代的真正来临,也许真的不远了。

相关推荐
清风百草1 小时前
【05】AI辅助文档管理:开发者的效率革命
人工智能·ai辅助文档管理·开发者的效率革命
甲维斯2 小时前
Gemini锐评GPT6:我要泼冷水扒底裤!
人工智能
2501_928996222 小时前
GPT-4o换DeepSeek迁移成本多少?中科热备解析API聚合平台技术账本
前端·数据库·人工智能
敢敢のwings2 小时前
ACT-2 深度解析:家用机器人如何把“会做”推进到“可靠地做”
人工智能·机器人
DM今天肝到几点?2 小时前
AI 安全进入「攻防同频」:Gemini 3.8 Flash Cyber 上线、Astra 触及关键级、HiddenLayer 融资 1 亿美元
网络·人工智能·深度学习·安全·语言模型·开源·知识图谱
智购科技自动贩卖机2 小时前
自动售货机嵌入式状态机设计实战:从45个事件源到层次型状态机的工程重构
大数据·人工智能·stm32·物联网·重构·硬件架构
乐迪信息3 小时前
智慧港口船舶AI算法实现在线状态监测
大数据·人工智能·深度学习·算法·计算机视觉
markvivv3 小时前
读《OpenViking:上下文数据库架构介绍》有感
人工智能·上下文工程
Raas1003 小时前
MAI Gateway(魔芋企业级AI网关)对比分析:AI网关和API网关区别?企业级能力差距一览
大数据·人工智能·数据挖掘·mai gateway·企业级产品