Grok 4.8 完成训练:2.5 万亿参数押注 AGI,DeepSeek 押注 2.5 倍效率------企业该跟哪条路线?
核心结论 :9 月中旬大模型行业出现两条路线的正面交锋------马斯克官宣 Grok 4.8(2.5 万亿参数、全新 C++ 训练栈)本周完成预训练、进入强化学习,并放话"AGI 在 Grok 5";同一周 DeepSeek 把 Flash 闲时价格砍 60%、蚂蚁百灵用 1/64 激活的 MoE 把吞吐拉上去。一边是"堆参数冲 AGI",一边是"压成本拼效率"。企业不需要站队,需要分层:80% 业务用效率路线的模型跑量,5% 核心推理才用旗舰。押错路线的代价,不是技术选型失败,而是三年后 TCO 差一个数量级。
一、Grok 4.8 的 2.5 万亿:参数军备竞赛还在加码
先把马斯克在 X 和 All-In Summit(9 月 15 日洛杉矶)放出的路线图摊开:
| 版本 | 状态 | 对标 / 定位 |
|---|---|---|
| Grok 4.6 | 8 月已发布 | 与 GPT-5.6 持平(Artificial Analysis 智能指数 61 分) |
| Grok 4.7 | 迭代中 | 接近 Anthropic Opus 5.0 |
| Grok 4.8 | 本周完成预训练,进 RL | 2.5 万亿参数,全新 C++ 训练栈 |
| Grok 4.9 | 规划中 | 可能对标 OpenAI Astra / Anthropic Fable |
| Grok 5 | 远期 | 马斯克原话"这将会是 AGI" |
数据来源:马斯克 X 平台公开帖(2026-09-14/15)、All-In Summit 现场发言(9/15)、IT之家/TechWeb/BeInCrypto 综合报道(2026-09-14 至 9-16)。
几个值得架构师注意的细节:
- 2.5 万亿参数不是传统稠密模型。在 MoE 成为主流的 2026 年,这个量级意味着激活参数和训练算力都站上了新台阶。
- 全新 C++ 软件栈。马斯克团队抛弃了主流 Python 训练框架生态,自研 C++ 栈------这背后是对训练效率和调度粒度的极致追求,也是 SpaceX 系工程文化的延续。
- "嘴上说慢,手上没慢"。9 月 12 日 Anthropic CEO 阿莫代伊发表长文呼吁放慢 AI,马斯克随即公开赞同"AI 风险显著";但两天后他就官宣 Grok 4.8 完成训练。他在峰会上的讽刺很直白:"一边说有 10% 概率毁灭人类,一边问 IPO 里想认购多少份额。"
二、另一面:效率路线在偷偷赢市场
参数路线在新闻头条里热闹,但钱正在流向另一个方向。
OpenRouter 数据(9 月 16 日):用户在 OpenAI 模型上的周支出时隔两年半反超 Anthropic,OpenRouter 分析主管 Peter Walker 将其归因于 OpenAI 新模型 Astra------但更值得注意的是,中腰部增长最快的调用量来自 Flash 级低价模型(东方财富 9/16)。
DeepSeek V4.1 Flash(9/10 发布):闲时输入价从 0.05 元/百万词元砍到 0.02 元,降幅 60%;9 月 14 日已下线 V4 Pro,流量全部切到新模型(36氪 9/10)。
蚂蚁百灵(外滩大会 9/12):高稀疏 MoE + 混合线性注意力,仅激活 1/64 参数,FP8 训练吞吐 +30%,正探索 FP4 预训练------用更低的 FLOPs 撬动同等智能。
SGLang + 蚂蚁:基数树缓存 + PD 分离,高并发 Agent 吞吐 2.7 倍,长程任务从 10 分钟压到 2 分钟。
两条路线的本质区别:
| 维度 | 参数路线(Grok 4.8 / 前沿旗舰) | 效率路线(Flash / MoE 稀疏 / 端侧小模型) |
|---|---|---|
| 核心假设 | 智能随参数增长 | 智能可通过架构和系统压缩 |
| 训练栈 | 自研 C++ 栈,追求极限算力利用 | 开源框架 + 稀疏激活 + 低精度 |
| 定价策略 | 高单价,瞄准复杂推理 | 分币级,靠走量和缓存 |
| 目标场景 | AGI、长程科研、复杂 Agent | 日常业务、高并发、成本敏感 |
| 企业接入方式 | API 调用,按量付费 | 可自托管、可蒸馏、可 SFT |
| 代表玩家 | xAI / OpenAI / Anthropic / Google | DeepSeek / 阿里 / 智谱 / 蚂蚁 / Mistral |
三、三个被新闻忽略的硬信号
1. 内存价格涨了 5-7 倍
英特尔 CEO 陈立武近日公开警告:内存短缺还会继续恶化,电力供应和冷却技术成为半导体行业接下来必须面对的两大问题;很多项目因为拿不到足够内存被迫延期(每日经济新闻 9/17)。
这对企业选型的含义是:推理成本不会一直下降。昨天我们算过 Token 效率账,今天要加一条------显存和内存是硬约束。盲目堆上下文、堆并发,会先卡在 HBM 上而不是模型能力上。
2. 扎克伯格公开反对"减速论"
Meta CEO 扎克伯格近日公开表示:AI 实验室依靠独立评估者和顾问足以确保安全,不需要放缓开发;但同时他承认 Meta 因"安全和保障"主动推迟了 Muse AI 上市(每日经济新闻 9/17)。
这句话的潜台词是:大厂在监管口径上分裂了。Anthropic 喊减速、OpenAI 跟进披露异常行为、xAI 闷头冲 2.5 万亿、Meta 公开反对减速。企业不能再假设"行业会统一节奏"------你选的模型供应商,可能明年就因为安全事件被监管点名。
3. OpenAI 估值冲到 1.2 万亿美元
OpenAI 正就新一轮私募融资与投资者初步接触,拟定估值 1.2 万亿美元,较今年 3 月的 8520 亿美元大幅跃升(每日经济新闻 9/17)。
这个数字的意义不是"贵",而是资本已经在为"AGI 路线"定价 。如果 OpenAI、xAI 都按 AGI 估值,它们的 API 定价会长期维持高位------因为要支撑这个估值,必须证明单位调用能赚更多钱。这对企业的直接影响是:旗舰模型的价格战不会持续太久,现在是用低价锁合同、做迁移的窗口期。
四、企业选型:不是站队,是分层
我在过去 15 个企业级 AI 项目里反复验证一个结论:没有一家企业需要"只用最强模型",也没有一家能"只用最便宜模型"。合理的做法是三层模型架构:
| 层级 | 任务类型 | 推荐模型档 | 成本占比目标 |
|---|---|---|---|
| L1 主力层 | 日常问答、文档处理、标准客服 | Flash 级 / 百 B 自蒸馏 / 端侧小模型 | 60%-70% 调用量,<30% 成本 |
| L2 专家层 | 复杂分析、代码生成、长文写作 | 百 B 旗舰 + 定向 SFT | 20%-30% 调用量,~30% 成本 |
| L3 旗舰层 | 架构设计、科研推理、疑难排障 | 最新旗舰(Grok/Astra/Opus 级) | <5% 调用量,~40% 成本 |
关键工程动作:
- 先上路由模型。一个轻量分类器把任务分三档------这是昨天讲的"蚂蚁灵犀省 38.9% 成本"的核心。
- 给 L1 做 SFT 和蒸馏。把旗舰模型的输出沉淀成百 B 级专用模型,成本降一个数量级。
- L3 别自建,走 API。2.5 万亿参数级别的模型,自建推理没有任何经济性;跟签长期合同锁价。
- 盯内存和电力账单。显存涨 5-7 倍的环境下,自托管模型的 TCO 要把硬件涨价算进去。
五、Q&A
Q1:Grok 4.8 的 2.5 万亿参数是真的吗?能打过 GPT-5.6 吗?
2.5 万亿参数来自马斯克本人 X 平台帖,第三方尚未独立验证;Grok 4.6 在 Artificial Analysis 智能指数上是 61 分、与 GPT-5.6 持平,4.8 还在 RL 阶段,实际能力要等发布后第三方跑分。架构师现在不要替厂商做性能背书。
Q2:企业要不要等 Grok 4.8 发布后再做选型?
不要。Grok 4.8 即使本周完成预训练,从 RL、对齐、安全评估到 API 开放通常还要 2-4 个月。企业选型的时间窗比模型发布节奏快------现在该做的是把 L1/L2 层跑通,L3 层保留切换能力,不要被任何单一旗舰绑死。
Q3:参数路线和效率路线,哪个会赢?
我的判断是长期共存、按场景分层。AGI 级任务需要参数路线,但 95% 的企业业务不需要 AGI------效率路线在绝大多数场景的 ROI 更高。押注单一路线的企业,未来三年会被 TCO 教育。
Q4:内存涨 5-7 倍,对我们自托管模型有什么影响?
直接影响 TCO。HBM 和 DDR 涨价会推高推理服务器采购成本 20%-40%(以英特尔 CEO 陈立武表态为参照)。建议:高并发在线服务优先用云端托管(厂商承担硬件折旧),离线批量任务错峰跑;自托管只放在有长期稳定负载的场景。
六、给技术决策者的 3 条判断
- 不要被头条节奏带跑。Grok 4.8、Astra、Fable 这些旗舰发布是 CTO 层面的战略雷达,不是你这周要接入的产品。你的架构应该假设"任何旗舰模型每 6 个月迭代一次",保持可替换性。
- 把"模型分层"写进架构文档。L1/L2/L3 的调用比例、成本占比、路由规则,应该和数据库分库分表一样成为基础设施决策,而不是每个项目临时拍脑袋。
- 现在是锁低价合同的窗口。OpenAI 估值 1.2 万亿、xAI 冲 AGI------旗舰模型涨价是大概率事件;Flash 级低价也有保质期(缓存命中定价会随竞争格局调整)。批量任务、长上下文任务,优先签 6-12 个月的低价协议。
关于作者:AI 架构的深耕者,智能价值的转化者。11 年全栈 AI 架构与技术掌舵经验,立足架构设计与战略决策双视角,精通大模型全链路工程化部署,独握端侧 AI 软硬一体化核心技术。主导 15+ 企业级 AI 项目从蓝图到落地,累计创造超 2000 万合同价值,服务千万级用户与 500+ 企业。关注我,一起把前沿 AI 变成可落地的商业价值。
数据来源:马斯克 X 平台公开帖(2026-09-14/15);All-In Summit 现场发言(2026-09-15,洛杉矶);每日经济新闻《数智早参》(2026-09-17);东方财富网 OpenRouter 周支出数据(2026-09-16);36氪 DeepSeek V4.1 Flash 发布报道(2026-09-10);IT之家/TechWeb 关于 Grok 4.8 训练进度的综合报道。Grok 参数规模与对标关系均为马斯克本人表态,第三方尚未独立验证;价格与估值数字以官方公告为准。
本文基于 2026-09-17 可查证的公开信息撰写,不构成投资建议。