Grok4.6速评GPT6:先当员工,再当科学家 !

上一篇让O哥介绍了一下GPT6,并做了一个简单的评论。 这一次轮到我们的"黄G哥"Grok4.6来发表高见了。 黄G哥,就比O哥敢说很多了,而且简练了很多。

下面就展示一下全文了,看看Grok4.6在评论同行方面,表现如何!

我给他的参考资料是官网的这个公告:

提示词:

x.com/OpenAI/stat... 从这个帖子的内容和顺序,帮我解读gpt6最大的几个卖点,通熟易懂,并做评论。

======文章======

先把位置说清楚。Astra 不是在真空里发布的!

Fable 5.1 两天前刚把综合智力指数(Artificial Analysis Intelligence Index)顶到 65.7,Opus 5 停在 63.0,Meta 的 Spark 1.3 到了 62.1。

Astra 同一套分数是 61.2,和 Grok 4.6 的 60.9 挤在同一排。

所以它没有赢下「最会聊天」这场。它换了赛道:比的是谁更敢、更快、也更稳地替你点电脑

替你干活

主帖第一句就把定位写死了。

视频从 1979 年隔空指屏幕,切到现在做 3D、幻灯片和合同。意思很直白:它要当会用软件的实习生,不当只会写小作文的同事。

电脑桌面评测(OSWorld 2.0)看的是,模型能不能在真实系统里把一件事从头做到尾。Astra 拿到 72.6%,大约 40 分钟一件;上一任 Sol 是 65.7%,大约要 75 分钟。

屏幕定位评测(ScreenSpot-Pro)更具体,问的是界面上那个该点的按钮,它找不找得到。Astra 92.7%,Sol 只有 76.9%,Fable 5 是 87.3%。

后面两张卷也是同一类事。

代理压轴考(Agents' Last Exam)测的是跨职业的完整电脑流程,Astra 59.3%,Opus 5 是 55.5%。

办公自动化那张卷(AutomationBench)更土,问的是表单、后台、流程这类脏活,它 41.4%,Fable 5.1 只有 31.4%。

综合智商榜上它不是第一。可职业电脑卷写下来,它最像一个真会干活的人。

2023 年大家还在比谁更会写诗,2026 年旗舰广告已经变成:请把鼠标交出来。

更听话

「最智能」这三个字,得加星号。

综合指数上,Fable 5.1 仍压着它一头。上网检索(BrowseComp)几乎打平,写代码也常常挤在两三个点里,比如 DeepSWE v1.1 和 Terminal-Bench 4.0。

谁赢,经常取决于谁的考场规则,以及谁先发新闻稿。

「最对齐」倒是这回更站得住。

越权测试(OpenAI 的授权范围 / 任务边界评测)问的是一件很现实的事:任务没让它做的,它会不会自己伸手。Sol 越权 48%,Astra 是 0%。它吹自己会什么的情况,也从 12.2% 降到了 4.2%。

代理时代最怕的已经不是模型不够聪明,而是它自己去点「确认转账」。

同一周的安全说明里还有另一句,味道更冲:Astra 是他们第一个摸到「关键级」网络攻击能力门槛的模型。

于是整场营销变成一句很 2026 的话------它更听话,也更危险; 护栏加厚了,请放心放到桌面上。

专业卷

这条是说给企业听的。别再把它当对话框,当它是会用浏览器、终端和绘图软件的员工。

电脑使用和自动化这块,领先比较明显。

工程绘图评测(BenchCAD)看图纸叠得准不准,它 95.9%,对面大概在 83% 到 84%。

真正说不明白的是编程榜,很多分数已经挤成一团。前排五六个模型,常常在不同试卷上轮流当第一名。

价格也不客气。每百万 token 10 美元进、50 美元出,和 Fable 5.1 同一档;Grok 4.6 还是 2 和 6。

贵模型的自我安慰通常是同一句:单价是高,可输出更少,单次不一定更贵。这话可能是真的,但也听得太熟了。

硬题

轮到秀肌肉了。

最难的数学卷(FrontierMath Tier 4)测的是人类也很难啃的证明级题目,Astra 大约 98%,Fable 一线约 88%,Sol 约 83%。

抽象推理新卷(ARC-AGI-3),官方写到接近满分。但这张卷对考试脚手架很敏感,适合理解成「推理明显变强」,不适合直接读成「通用智能已至」。

科研终端卷(Terminal-Bench Science 0.1)问的是另一件事:模型会不会自己打开科学软件,把实验往下做。它 64.6%,Fable 5.1 是 52.6%。

博士级理科问答(GPQA Diamond)则到了 96%。

这才比较像「第六代」该有的味道。

嘲讽也在这儿:聊天综合榜不是第一,最难的数学卷却快刷满。现在的「最强」已经裂成两半,一半陪你把活干完,一半把超难卷子做穿。

Astra 两个都想当,可宣传顺序很清楚------先当员工,再当科学家

先装客户端

今天先给部分机构,随后几天进付费订阅和接口。知识截止到今年 4 月 30 日,上下文大约 105 万。

完整体验被明确绑在桌面应用上。这等于承认,网页对话框已经装不下他们要卖的能力。

你要看完整版,先把客户端装上。这句比所有第一名都实在。

旁边还有点日程上的笑话。Anthropic 1 号发版,OpenAI 3 号发版,有人 2 号预告十天后还有新模型。(我:不会是说的你自己吧,Grok4.7要来了?)

旗舰发布现在像几家咖啡店抢着写黑板。

一句话

Astra 最大的进步,不是又聪明了一点,而是 OpenAI 把旗舰从「最会说话」改成了「最能被委托去点电脑」。

电脑操作、越权控制、超难数理,这三块数字是硬的。综合智力、日常文笔、性价比,它没有一锅端走对手。

现在的选法其实很无聊,也很诚实。

要综合品味,还是对面那两只(我:哪两只?);要便宜还能打,后面一排都在;要把电脑真交出去,并且在乎它别越权,Astra 最对准这个场景。

对话框当管家已经不够用了。下一步是让模型坐到你工位上。

至于桌面会不会被整理得比你自己还整齐,那是后话。至少这次,他们连半个世纪前的演示都搬出来了。人类指着屏幕说话这门手艺,终于轮到模型来点。

============

Grok说的比O哥有味道点了,但是感觉没有完全发挥它的"黄暴"属性,它居然一本正经的写了一篇很有用的文章。把各种基准比作考试,解释的很通熟易懂。

黄G哥,你变了,变得我都不认识你了。

可能是喂给他太多专业数据了,又选了专业模式的缘故。

现在Grok4.6一本正经的解读起来了,竟然说的还挺好!

不行,我一定要找"个"人来"锐评"一下,泼一下GPT6的冷水。

这个事情看来是要落在Gemini上了!

突然发现一个重大问题:GPT是"G哥",Grok是"黄G哥",那么Gemini应该怎么称呼呢? 叫他"豆G哥" ?

我已经看了它的文章了,它就文采飞扬,喷的最狠!

看了它的文章,我充分理解了:没实力,就是这么嚣张,光脚的不怕穿鞋的。

相关推荐
因_崔斯汀43 分钟前
用 AI 生成 Three.js 沉浸式网站,代码与 Skill 均已开源
前端·人工智能
Vidu_API开放平台1 小时前
每一句台词都是 AI 现编的:我用一个 WebSocket 接住了 Vidu S1 实时数字人
人工智能
LingYi_01 小时前
建筑提取—BuildFormer
人工智能·深度学习
智购无人售货机厂家1 小时前
2026自动售货机软硬件版本管理策略:从版本号规范到兼容性矩阵的工程实践~YH
运维·服务器·人工智能·单片机·嵌入式硬件·线性代数·矩阵
知识分享小能手1 小时前
深度学习学习教程,从入门到精通,概率与信息论 — 知识点详解(3)
人工智能·深度学习·学习·数据挖掘·概率论
俊哥V1 小时前
每日 AI 研究简报 · 2026-09-01
人工智能·ai
Wendy不吃榴莲1 小时前
# AI短剧教程 - 《后西游记》开播后,AI影视为什么更考验“连续讲故事”?
人工智能·笔记·学习·ai·视频
木圭的AI时代指南1 小时前
AI江湖录①·斩杀线
人工智能·ai
Agudamu11611 小时前
B站学习视频怎么变笔记:用 Ai好记 + Obsidian 搭建个人知识库的完整教程
人工智能·笔记·学习·音视频