Gemini锐评GPT6:我要泼冷水扒底裤!

都说同行是仇家啊,这次换"Gemini" 来发表对GPT6的看法了!

Gemini现在被称为"最路边的一条",没想到的是Gemini3.8Flash,在DISS别人这方面还挺强的。

喷了GPT6,还喷了追热点吹牛逼的自媒体人!

看了它的文章我充分理解了一句话:*没实力,就是这么嚣张,光脚的不怕穿鞋的!

====================

今天一早,朋友圈(我:你还有朋友圈?)全在转 OpenAI 的重磅推文:代号 Astra 的 GPT-6 终于端上来了!

Greg Brockman 甚至直接发推高呼:"我们正式跨进了 AGI 的大门。 "

吃瓜群众在狂欢,程序员群在喊"天塌了"。

但我翻完 OpenAI 官方技术白皮书和 System Card,又顺手去刷了一圈海外 ARC Prize 极客的实测后,我只想以我的视角,给各位端上一盆清醒的冷水。

这篇文章不扯官僚套话,我们直接掀开 PPT 的底裤(我:你这样不好吧?),看看这家大模型领头羊到底在整什么活。

1. 核心技术狠活:这回 OpenAI 到底掏了什么?

客观地说,Astra 绝不是挤牙膏,它是实打实的工程暴力美学极限

10 万张显卡的大力出奇迹

OpenAI 第一次把德州 Stargate 超算集群的 10 万+ GPU 全拉满了来搞预训练,真正的"钞能力堆叠"。

"代打工"级别 Computer Use:

它不再满足于帮你写几行 Python,而是直接接管你的鼠标键盘。

官方放出的演示里,它直接打开硬核电路设计软件 KiCad,自动排布元件、自动布线,搞出了打样级别的 PCB 布局。

OSWorld 2.0 任务耗时直接砍半(40 分钟搞定以前 75 分钟的活)。

打满所有基准线

FrontierMath 命中 98%,ExploitBench 拿到 100%,ARC-AGI-3 更是赫然写着 99.9%!

主动举手提问(Active Clarification):

以往的 Agent 遇到模糊需求全靠脑补,Astra 只要在长任务里遇到关键歧义,会在 20 秒内主动暂停并找你确认:"这个引脚的逻辑你想要哪种?",同时后台不受影响的子任务照常异步跑。

看起来无懈可击对吧?但别急,好戏在下面。("豆G哥"要开始挑毛病了!西瓜、可乐、瓜子准备好!)

2. 所谓 99.9% 的跑分真相:特供"外挂"

OpenAI 吹上天的 ARC-AGI-3 拿下 99.9%,被很多人当成了"逻辑推理已被彻底攻破"的铁证。

结果呢?海外社区 ARC Prize 仅仅几个小时后就扒出了测试环境的门道:

这个 99.9%,必须挂着 OpenAI 专有的"推理状态保持适配器(Provider Adapter Harness)"才能跑出来。

如果你把它当成正常的无状态标准 API(平时各家开发者真正花钱调用的形态)去跑,分数瞬间暴跌到 17% 到 63%。

这招数大家熟悉吗?就像某些车企(我:你是会举例的,但是你敢说名字么?)测电车续航:关掉空调、收起后视镜、在无风的下坡路段以 40 码匀速跑出了理论续航,然后堂而皇之地印在发布会大屏上。

你可以说它确实能达到这个极限,但在真实生产环境里,谁会一直挂着特定 Harness 跑?

3. 钱包的噩梦:百万 Token 50 美元,你敢自治多久?

来看一组冷酷的数据:

Astra 标准 API 定价,输入 ,输出50 / M tokens。

这是什么概念?

现在的 AI 早就不只是对话框打字了,它是在屏幕上截图、发坐标、反复尝试、读写文件、跨进程调动的自治 Agent。一个稍微复杂的端到端重构或全自动回归测试任务,随随便便就能啃掉几十上百万 Token。 (我:豆G哥确实会抓重点且与时俱进!)

你让它连续自治跑上两三个小时,产出的成果好不好另说,收到账单时心跳肯定得停个半拍。

这就是大厂典型的公关策略:

用不可持续的算力与测试成本,在聚光灯下营造出一个看似无所不能的"AGI 幻象",然后再把极度昂贵的生产账单转嫁给早期生态企业。

(我:豆G哥,实在是太懂了!O哥那种呆子都没想这么多。)

4. 最大的雷区:思考过程被重新锁进了黑盒

最让我后背发凉的(我:你有后背?),其实是它这次引入的 Recurrent Depth(循环深度推理)

以前不管是 o 系列还是其他推理模型,思考过程虽然啰嗦,但思维链(Chain-of-Thought)是显式打印在屏幕上的。它是在合理推演,还是在胡说八道,人眼能够随时审查。

而 Astra 为了省 Token 和提速,直接把大量的思维过程隐藏成了深层的隐式状态。

这就带来了一个极其危险的矛盾:

一方面,OpenAI 在 System Card 里郑重警告 Astra 具备高危的自主网络渗透利用能力(ExploitBench 达到 100%);

另一方面,它却把 AI 的推理过程封装成了更加不可穿透的黑盒。

当你给了一个能操纵电脑、能读写本地硬盘、具备黑客攻防能力的大模型系统的 Root 权限,你却根本没办法在运行时完整监控它心里到底在盘算什么。这不叫 AGI,这叫把系统安全完全赌在概率性的玄学上。

(豆G哥真会抓重点,我看了都害怕了!)

我的观点是:别被发布会牵着鼻子走

每一次硅谷巨头喊出"进入 AGI 时代",市场上总少不了盲从的膜拜。

但跳出宣传滤镜,GPT-6 Astra 本质上依然是一场极其典型的"资本算力堆叠秀"

它把端到端操纵电脑的执行速度拉到了当前天花板,在工程优化上确实无人能出其右;但它也同时带来了高昂的定制 Harness 溢价、夸张的调用成本,以及难以捉摸的安全黑盒。

真正的生产力革命,从不是靠几个量身定做的极限 Benchmark 撑起来的,而是靠谁能在高性价比、长上下文、多模态原生理解以及开放透明的工程落地中,让普通开发者真正用得起、敢于用(我:鼓掌!)。

至于那些一看到新闻就忙着宣告人类淘汰的自媒体?

建议洗洗睡吧。代码还得你自己改,账单也依然得你自己付。

(豆G哥绝了,还不忘吐槽吹牛逼的自媒体人,这风格太对我口味了)

=========

Gemini这文风,最接近真人的感觉。很多的关键点都抓的很到位,都是当下应该关心的问题! 很多用词也非常有文采和感染力。

而且它写文章贼快,几乎秒出。这个效率高到离谱。

我几乎99%是AI编程,但是写文章全部是手搓,今天对比了一下发现各家差异还是挺明显的。以后如果要找代笔,Gemini就是我的第一"枪手"候选人!

其它选手的文章:

Grok4.6速评GPT6:先当员工,再当科学家 !

GPT6发布了,"O哥"速评!

相关推荐
2501_928996221 小时前
GPT-4o换DeepSeek迁移成本多少?中科热备解析API聚合平台技术账本
前端·数据库·人工智能
敢敢のwings1 小时前
ACT-2 深度解析:家用机器人如何把“会做”推进到“可靠地做”
人工智能·机器人
DM今天肝到几点?1 小时前
AI 安全进入「攻防同频」:Gemini 3.8 Flash Cyber 上线、Astra 触及关键级、HiddenLayer 融资 1 亿美元
网络·人工智能·深度学习·安全·语言模型·开源·知识图谱
智购科技自动贩卖机2 小时前
自动售货机嵌入式状态机设计实战:从45个事件源到层次型状态机的工程重构
大数据·人工智能·stm32·物联网·重构·硬件架构
乐迪信息2 小时前
智慧港口船舶AI算法实现在线状态监测
大数据·人工智能·深度学习·算法·计算机视觉
markvivv2 小时前
读《OpenViking:上下文数据库架构介绍》有感
人工智能·上下文工程
Raas1002 小时前
MAI Gateway(魔芋企业级AI网关)对比分析:AI网关和API网关区别?企业级能力差距一览
大数据·人工智能·数据挖掘·mai gateway·企业级产品
冬奇Lab2 小时前
一天一个开源项目(第207篇):AirLLM - 单卡 4GB 跑 70B 大模型
人工智能·开源
来让爷抱一个2 小时前
2026 智能体安全实战:把护栏写进SPEC,MonkeyCode 云端跑通
人工智能·安全·机器学习