都说同行是仇家啊,这次换"Gemini" 来发表对GPT6的看法了!
Gemini现在被称为"最路边的一条",没想到的是Gemini3.8Flash,在DISS别人这方面还挺强的。
喷了GPT6,还喷了追热点吹牛逼的自媒体人!
看了它的文章我充分理解了一句话:*没实力,就是这么嚣张,光脚的不怕穿鞋的!
====================
今天一早,朋友圈(我:你还有朋友圈?)全在转 OpenAI 的重磅推文:代号 Astra 的 GPT-6 终于端上来了!
Greg Brockman 甚至直接发推高呼:"我们正式跨进了 AGI 的大门。 "
吃瓜群众在狂欢,程序员群在喊"天塌了"。
但我翻完 OpenAI 官方技术白皮书和 System Card,又顺手去刷了一圈海外 ARC Prize 极客的实测后,我只想以我的视角,给各位端上一盆清醒的冷水。
这篇文章不扯官僚套话,我们直接掀开 PPT 的底裤(我:你这样不好吧?),看看这家大模型领头羊到底在整什么活。
1. 核心技术狠活:这回 OpenAI 到底掏了什么?
客观地说,Astra 绝不是挤牙膏,它是实打实的工程暴力美学极限。
10 万张显卡的大力出奇迹:
OpenAI 第一次把德州 Stargate 超算集群的 10 万+ GPU 全拉满了来搞预训练,真正的"钞能力堆叠"。
"代打工"级别 Computer Use:
它不再满足于帮你写几行 Python,而是直接接管你的鼠标键盘。
官方放出的演示里,它直接打开硬核电路设计软件 KiCad,自动排布元件、自动布线,搞出了打样级别的 PCB 布局。
OSWorld 2.0 任务耗时直接砍半(40 分钟搞定以前 75 分钟的活)。
打满所有基准线:
FrontierMath 命中 98%,ExploitBench 拿到 100%,ARC-AGI-3 更是赫然写着 99.9%!
主动举手提问(Active Clarification):
以往的 Agent 遇到模糊需求全靠脑补,Astra 只要在长任务里遇到关键歧义,会在 20 秒内主动暂停并找你确认:"这个引脚的逻辑你想要哪种?",同时后台不受影响的子任务照常异步跑。
看起来无懈可击对吧?但别急,好戏在下面。("豆G哥"要开始挑毛病了!西瓜、可乐、瓜子准备好!)
2. 所谓 99.9% 的跑分真相:特供"外挂"
OpenAI 吹上天的 ARC-AGI-3 拿下 99.9%,被很多人当成了"逻辑推理已被彻底攻破"的铁证。
结果呢?海外社区 ARC Prize 仅仅几个小时后就扒出了测试环境的门道:
这个 99.9%,必须挂着 OpenAI 专有的"推理状态保持适配器(Provider Adapter Harness)"才能跑出来。
如果你把它当成正常的无状态标准 API(平时各家开发者真正花钱调用的形态)去跑,分数瞬间暴跌到 17% 到 63%。
这招数大家熟悉吗?就像某些车企(我:你是会举例的,但是你敢说名字么?)测电车续航:关掉空调、收起后视镜、在无风的下坡路段以 40 码匀速跑出了理论续航,然后堂而皇之地印在发布会大屏上。
你可以说它确实能达到这个极限,但在真实生产环境里,谁会一直挂着特定 Harness 跑?
3. 钱包的噩梦:百万 Token 50 美元,你敢自治多久?
来看一组冷酷的数据:
Astra 标准 API 定价,输入 ,输出50 / M tokens。
这是什么概念?
现在的 AI 早就不只是对话框打字了,它是在屏幕上截图、发坐标、反复尝试、读写文件、跨进程调动的自治 Agent。一个稍微复杂的端到端重构或全自动回归测试任务,随随便便就能啃掉几十上百万 Token。 (我:豆G哥确实会抓重点且与时俱进!)
你让它连续自治跑上两三个小时,产出的成果好不好另说,收到账单时心跳肯定得停个半拍。
这就是大厂典型的公关策略:
用不可持续的算力与测试成本,在聚光灯下营造出一个看似无所不能的"AGI 幻象",然后再把极度昂贵的生产账单转嫁给早期生态企业。
(我:豆G哥,实在是太懂了!O哥那种呆子都没想这么多。)
4. 最大的雷区:思考过程被重新锁进了黑盒
最让我后背发凉的(我:你有后背?),其实是它这次引入的 Recurrent Depth(循环深度推理) 。
以前不管是 o 系列还是其他推理模型,思考过程虽然啰嗦,但思维链(Chain-of-Thought)是显式打印在屏幕上的。它是在合理推演,还是在胡说八道,人眼能够随时审查。
而 Astra 为了省 Token 和提速,直接把大量的思维过程隐藏成了深层的隐式状态。
这就带来了一个极其危险的矛盾:
一方面,OpenAI 在 System Card 里郑重警告 Astra 具备高危的自主网络渗透利用能力(ExploitBench 达到 100%);
另一方面,它却把 AI 的推理过程封装成了更加不可穿透的黑盒。
当你给了一个能操纵电脑、能读写本地硬盘、具备黑客攻防能力的大模型系统的 Root 权限,你却根本没办法在运行时完整监控它心里到底在盘算什么。这不叫 AGI,这叫把系统安全完全赌在概率性的玄学上。
(豆G哥真会抓重点,我看了都害怕了!)
我的观点是:别被发布会牵着鼻子走
每一次硅谷巨头喊出"进入 AGI 时代",市场上总少不了盲从的膜拜。
但跳出宣传滤镜,GPT-6 Astra 本质上依然是一场极其典型的"资本算力堆叠秀" :
它把端到端操纵电脑的执行速度拉到了当前天花板,在工程优化上确实无人能出其右;但它也同时带来了高昂的定制 Harness 溢价、夸张的调用成本,以及难以捉摸的安全黑盒。
真正的生产力革命,从不是靠几个量身定做的极限 Benchmark 撑起来的,而是靠谁能在高性价比、长上下文、多模态原生理解以及开放透明的工程落地中,让普通开发者真正用得起、敢于用(我:鼓掌!)。
至于那些一看到新闻就忙着宣告人类淘汰的自媒体?
建议洗洗睡吧。代码还得你自己改,账单也依然得你自己付。
(豆G哥绝了,还不忘吐槽吹牛逼的自媒体人,这风格太对我口味了)
=========
Gemini这文风,最接近真人的感觉。很多的关键点都抓的很到位,都是当下应该关心的问题! 很多用词也非常有文采和感染力。
而且它写文章贼快,几乎秒出。这个效率高到离谱。
我几乎99%是AI编程,但是写文章全部是手搓,今天对比了一下发现各家差异还是挺明显的。以后如果要找代笔,Gemini就是我的第一"枪手"候选人!
其它选手的文章: