Grok 4.6 正式发布!性能直接飙升,xAI 这次真的开始冲击第一梯队! 可免费试用 2026年8月20日 admin AI xAI

就在前几天,SpaceXAI 正式发布了全新的 Grok 4.6。乍一看,这似乎只是一次从 Grok 4.5 到 Grok 4.6 的小版本升级。但如果仔细看 xAI 公布的测试结果,你会发现,这次升级并没有想象中那么简单。

Grok 4.6 已经开始将重点从单纯的"聊天能力",转向更加复杂的长程 Agent、Coding、知识工作以及交互式项目开发。甚至在 Artificial Analysis Intelligence Index 上,Grok 4.6 已经与 GPT-5.6 Sol 达到了相同的综合分数。换句话说,Grok 4.6 已经正式进入了当前顶级模型的竞争范围。而这也是这一次 Grok 4.6 最值得关注的地方。

安装运行

xAI官方已经提供了免费的试用通道,如果希望通过命令行免费体验 Grok,可以安装官方 CLI来使用,一键安装命令如下:

Windows PowerShell

bash 复制代码
irm https://x.ai/cli/install.ps1 | iex

Linux / macOS / WSL

bash 复制代码
 
curl -fsSL https://x.ai/cli/install.sh | bash

从 Grok 4.5 到 4.6,到底升级了什么?

按照 xAI 官方的说法,Grok 4.6 的核心目标非常明确:让模型能够处理更加漫长、更加复杂、更加需要持续执行的任务。过去我们使用 AI,更多还是"一问一答"。你提出问题,模型回答。让模型写代码,它可能给你一段代码。让模型分析资料,它可能给你一份分析。

但真正复杂的工作往往不是这样。例如:"研究一个陌生领域,然后整理资料,设计一个产品方案,再写出第一版程序,运行测试,发现问题以后继续修改,最后生成一个可以直接使用的成果。"

这类任务最大的难点,并不是某一个步骤有多难,而是需要 AI 连续执行几十个甚至上百个步骤,而且不能在中途"迷路"。Grok 4.6 就是针对这种长程任务进行了重点强化。

xAI 表示,Grok 4.6 在研究、信息分析、跨代码库工作,以及将想法转化成完整应用或工作成果等场景中,都能够持续执行更多步骤。尤其是在医疗领域的Agent能力,MedAgentBench 以95.9%的最高准确率,拿下全球第一的水平!

这意味着 Grok 4.6 的定位已经越来越接近一个真正的 AI Agent。比如我让它用一句话来生成CS射击游戏,它只用了半小时不到,就完成了一个功能完善,UI界面精美,功能无错的游戏代码!

长程 Agent,成为 Grok 4.6 的核心能力

这一次 Grok 4.6 最明显的变化,就是对 Agent 能力进行了大幅强化。xAI 在训练 Grok 4.6 的时候,并没有只针对普通聊天场景进行优化,而是加入了大量 Agentic RL 任务。

这些任务覆盖了知识工作、通用 Coding,以及内核优化、Web 开发、计算机辅助设计等更加专业的工作环境。

这实际上非常重要。

因为对于一个真正的 Agent 来说,最重要的并不是"会不会回答问题",而是:

能不能把一个复杂目标拆开,然后持续把事情做完。

例如你给它一个需求:

"帮我做一个网页应用。"

普通模型可能直接给你 HTML、CSS 和 JavaScript。

但 Agent 型模型需要进一步完成:

理解需求 → 规划页面 → 编写代码 → 运行 → 检查错误 → 修改 → 再运行 → 优化交互 → 最终交付。

这才是 AI Agent 真正有价值的地方。

•AD -

而 xAI 官方也特别展示了 Grok 4.6 将一个模糊的产品想法逐渐转化成可运行项目的能力。

在测试中,Grok 4.6 能够先研究陌生领域,然后构建应用结构,实现核心交互,再根据反馈进行多轮修改。

相比 Grok 4.5,它在视觉和交互式项目上的第一版输出也有明显提升。

简单来说:

以前的 AI 更像程序员助手,现在的 Grok 4.6 开始越来越像一个可以自己干活的程序员。

Coding 能力进一步提升

如果说 Agent 是 Grok 4.6 的核心,那么 Coding 就是它最重要的应用场景之一。

从 xAI 公布的 Model Card 来看,Grok 4.6 属于 1.5T 规模模型家族,并且针对软件工程、工程任务以及办公室知识工作进行了进一步训练。

在 DeepSWE v1.1 这一长程软件工程测试中,Grok 4.6 在 high thinking effort 下取得了 65.9% 的成绩,在 xhigh 下进一步达到 67.0%。

这意味着它不仅仅是在代码补全或者简单 Debug 上变强,而是在更加接近真实软件开发的长程任务中获得了明显提升。

•AD -

与此同时,在 Terminal-Bench 3.0 中,Grok 4.6 的任务成功率达到 26.0%。

这个测试更加接近真实的终端 Agent 工作环境,需要模型处理软件、机器学习、科学、运维、硬件以及媒体工作流等复杂任务。

而且 Grok 4.6 已经进入 GitHub Copilot。

开发者可以直接在 GitHub Copilot 的模型选择器中选择 Grok 4.6,在 VS Code、Copilot CLI 以及云端 Agent 等环境中使用它。

这也说明,Grok 4.6 并不是一个只在 Grok 聊天界面里"自己玩"的模型。

它正在逐渐进入真正的开发工作流。

知识工作同样成为重点

除了 Coding,Grok 4.6 另外一个非常重要的方向就是 Knowledge Work,也就是知识工作。

简单来说,就是让 AI 不只是回答一个问题,而是直接帮你完成一项工作。

•AD -

例如:

撰写报告、分析数据、整理资料、制作商业文档、生成方案、处理复杂的多文件项目等等。

在 Artificial Analysis 的 GDPVal-AA 测试中,Grok 4.6 获得了 1753 Elo。

这个成绩已经进入顶级模型竞争区间,仅次于部分更高端的模型。

在 AA-Briefcase 这种长周期专业知识工作测试中,Grok 4.6 也取得了 1577 Elo。

这类测试的意义在于,它更加接近真实工作。

因为现实中的工作往往不是:

"帮我写一段话。"

而是:

"根据这些资料,做一个完整分析,最后交付一份可以直接给老板看的报告。"

中间可能涉及几十个步骤。

而这正好是 Grok 4.6 想解决的问题。

Grok 4.6 为什么会有这么明显的提升?

xAI 在训练方式上也做了一些变化。

官方表示,Grok 4.6 进行了比 Grok 4.5 更长的补充训练,并加入了大量模型生成的数据、高质量工程数据以及针对推理和高级技术概念的数据。

与此同时,xAI 还利用 Grok 4.5 生成不同推理强度、Agent Harness 和不同领域的 SFT 轨迹,然后通过模型检查过滤掉存在问题的训练轨迹。

之后,再通过针对知识工作、Coding、工程环境等任务的 Agentic RL 进一步训练。

也就是说,这一次 Grok 4.6 并不是简单地"增加一点训练数据"。

而是开始更加系统地围绕 Agent + Coding + Knowledge Work 这三个方向进行强化。

这其实也是现在 AI 模型发展的一个明显趋势。

模型竞争正在从:

•AD -

"谁更会聊天?"

逐渐转向:

"谁真正能够把事情做完?"

与 GPT-5.6、Fable 5 等顶级模型正面竞争

这也是为什么 Grok 4.6 发布之后,引起了比较大的关注。

从 xAI 官方公布的 Artificial Analysis Intelligence Index 来看,Grok 4.6 与 GPT-5.6 Sol 达到了相同的综合分数。

而在具体的 Coding 和知识工作测试中,Grok 4.6 也在多个项目里进入了第一梯队。

当然,这并不意味着 Grok 4.6 在所有测试中都全面领先。

不同模型在不同任务上的表现依然存在明显差异。

例如在部分软件工程测试中,Opus、GPT-5.6 和 Fable 5 依然保持非常强的竞争力。

所以更准确的说法应该是:

Grok 4.6 已经从"顶级模型竞争者"变成了"第一梯队的正式参与者"。

而且它的优势方向非常明确:

长程 Agent、Coding、知识工作以及交互式项目开发。

500K 上下文,也让长程任务更加现实

Grok 4.6 还提供了最高 500K 的上下文窗口。

这对于 Agent 来说非常重要。

因为 Agent 在执行复杂任务的时候,需要不断积累上下文。

代码、运行日志、用户需求、工具调用结果、错误信息、修改记录......

如果上下文太小,模型很容易在长任务中遗忘之前的信息。

而更大的上下文窗口,可以让模型在一次任务中保留更多信息。

这也是为什么现在顶级模型都开始不断扩大上下文长度。

AI 的下一阶段,已经不只是"回答一个问题"。

而是:

把整个项目交给 AI。

Grok 4.6 已经可以直接使用

目前 Grok 4.6 已经可以通过多个入口使用。

xAI 官方发布时首先将它带到了 Grok Build 和 Cursor,并提供了首周额外使用额度,让用户可以直接体验。

同时,Grok 4.6 也已经进入 GitHub Copilot。

对于开发者来说,可以直接在模型选择器中选择 Grok 4.6。

如果你希望通过 API 使用,xAI 官方文档已经提供了 grok-4.6 模型接口。

Grok 4.6 官方发布页面

Grok 4.6 API 官方文档

此外,Grok 4.6 目前也已经登陆 Amazon Bedrock,提供 500K 上下文窗口以及可配置的 reasoning effort。

写在最后

从 Grok 4.5 到 Grok 4.6,看起来只是从 4.5 变成了 4.6。

但实际上,这一次升级背后的方向非常值得关注。

xAI 正在明显地把 Grok 从一个聊天机器人,向真正的 AI Agent 推进。

它不再满足于回答问题,而是开始研究:

如何理解一个复杂目标。

如何规划任务。

如何连续执行几十个步骤。

如何编写和修改代码。

如何处理真实的软件工程环境。

如何把一个模糊的想法最终变成一个可以运行的项目。

这可能才是 Grok 4.6 真正重要的地方。

而现在,AI 第一梯队的竞争也正在发生变化。

GPT-5.6、Fable 5、Opus、Grok 4.6 等模型之间的差距正在越来越小。

接下来真正决定胜负的,可能已经不是谁的聊天回答更加漂亮。

而是谁能够真正做到:

你只需要告诉 AI 你想要什么,剩下的事情,它自己完成。

这也意味着,属于 AI Agent 的时代,可能真的已经开始了。

相关推荐
白露与泡影1 小时前
解密 Pi 的 Harness 工程:Agent 会话如何实现持久化与恢复
java·人工智能·算法
DogDaoDao1 小时前
Magma:微软如何用一个模型打通数字与物理世界的 AI Agent
人工智能·微软·机器人·大模型·机器人模型·智能体·magma
DS随心转插件1 小时前
Grok生成的html怎么导出——AI导出鸭:大模型结构化输出的“最后一公里”工程化解构
前端·人工智能·ai·html·豆包·deepseek·ai导出鸭
世隆科技1 小时前
武汉世隆科技有限公司获评2026湖北省科创“新物种“瞪羚企业
人工智能
yinmaisoft1 小时前
当 AI“长”进低代码:从外挂点缀到原生融合,软件开发正在经历怎样的变革?
人工智能·低代码
2301_786756601 小时前
今日未放榜!国自然等待期,别被往年“周五经验”绑架
大数据·人工智能·科研·国自然·国家自然科学基金
进军的码农2 小时前
政府采购联想工作站:授权链合规验证+投标资质+代理商选择全指南
人工智能·技术支持·联想工作站·代理商推荐·cuda部署
东离与糖宝2 小时前
GLM‑5.3+ZCode原配登场!实测一下午重构完整导航站
人工智能
lailai04102 小时前
学校AI教学功能类型
人工智能