Grok 4.8 完成训练:2.5 万亿参数押注 AGI,DeepSeek 押注 2.5 倍效率——企业该跟哪条路线?

Grok 4.8 完成训练:2.5 万亿参数押注 AGI,DeepSeek 押注 2.5 倍效率------企业该跟哪条路线?

核心结论 :9 月中旬大模型行业出现两条路线的正面交锋------马斯克官宣 Grok 4.8(2.5 万亿参数、全新 C++ 训练栈)本周完成预训练、进入强化学习,并放话"AGI 在 Grok 5";同一周 DeepSeek 把 Flash 闲时价格砍 60%、蚂蚁百灵用 1/64 激活的 MoE 把吞吐拉上去。一边是"堆参数冲 AGI",一边是"压成本拼效率"。企业不需要站队,需要分层:80% 业务用效率路线的模型跑量,5% 核心推理才用旗舰。押错路线的代价,不是技术选型失败,而是三年后 TCO 差一个数量级。

一、Grok 4.8 的 2.5 万亿:参数军备竞赛还在加码

先把马斯克在 X 和 All-In Summit(9 月 15 日洛杉矶)放出的路线图摊开:

版本 状态 对标 / 定位
Grok 4.6 8 月已发布 与 GPT-5.6 持平(Artificial Analysis 智能指数 61 分)
Grok 4.7 迭代中 接近 Anthropic Opus 5.0
Grok 4.8 本周完成预训练,进 RL 2.5 万亿参数,全新 C++ 训练栈
Grok 4.9 规划中 可能对标 OpenAI Astra / Anthropic Fable
Grok 5 远期 马斯克原话"这将会是 AGI"

数据来源:马斯克 X 平台公开帖(2026-09-14/15)、All-In Summit 现场发言(9/15)、IT之家/TechWeb/BeInCrypto 综合报道(2026-09-14 至 9-16)。

几个值得架构师注意的细节:

  1. 2.5 万亿参数不是传统稠密模型。在 MoE 成为主流的 2026 年,这个量级意味着激活参数和训练算力都站上了新台阶。
  2. 全新 C++ 软件栈。马斯克团队抛弃了主流 Python 训练框架生态,自研 C++ 栈------这背后是对训练效率和调度粒度的极致追求,也是 SpaceX 系工程文化的延续。
  3. "嘴上说慢,手上没慢"。9 月 12 日 Anthropic CEO 阿莫代伊发表长文呼吁放慢 AI,马斯克随即公开赞同"AI 风险显著";但两天后他就官宣 Grok 4.8 完成训练。他在峰会上的讽刺很直白:"一边说有 10% 概率毁灭人类,一边问 IPO 里想认购多少份额。"

二、另一面:效率路线在偷偷赢市场

参数路线在新闻头条里热闹,但钱正在流向另一个方向。

OpenRouter 数据(9 月 16 日):用户在 OpenAI 模型上的周支出时隔两年半反超 Anthropic,OpenRouter 分析主管 Peter Walker 将其归因于 OpenAI 新模型 Astra------但更值得注意的是,中腰部增长最快的调用量来自 Flash 级低价模型(东方财富 9/16)。

DeepSeek V4.1 Flash(9/10 发布):闲时输入价从 0.05 元/百万词元砍到 0.02 元,降幅 60%;9 月 14 日已下线 V4 Pro,流量全部切到新模型(36氪 9/10)。

蚂蚁百灵(外滩大会 9/12):高稀疏 MoE + 混合线性注意力,仅激活 1/64 参数,FP8 训练吞吐 +30%,正探索 FP4 预训练------用更低的 FLOPs 撬动同等智能。

SGLang + 蚂蚁:基数树缓存 + PD 分离,高并发 Agent 吞吐 2.7 倍,长程任务从 10 分钟压到 2 分钟。

两条路线的本质区别:

维度 参数路线(Grok 4.8 / 前沿旗舰) 效率路线(Flash / MoE 稀疏 / 端侧小模型)
核心假设 智能随参数增长 智能可通过架构和系统压缩
训练栈 自研 C++ 栈,追求极限算力利用 开源框架 + 稀疏激活 + 低精度
定价策略 高单价,瞄准复杂推理 分币级,靠走量和缓存
目标场景 AGI、长程科研、复杂 Agent 日常业务、高并发、成本敏感
企业接入方式 API 调用,按量付费 可自托管、可蒸馏、可 SFT
代表玩家 xAI / OpenAI / Anthropic / Google DeepSeek / 阿里 / 智谱 / 蚂蚁 / Mistral

三、三个被新闻忽略的硬信号

1. 内存价格涨了 5-7 倍

英特尔 CEO 陈立武近日公开警告:内存短缺还会继续恶化,电力供应和冷却技术成为半导体行业接下来必须面对的两大问题;很多项目因为拿不到足够内存被迫延期(每日经济新闻 9/17)。

这对企业选型的含义是:推理成本不会一直下降。昨天我们算过 Token 效率账,今天要加一条------显存和内存是硬约束。盲目堆上下文、堆并发,会先卡在 HBM 上而不是模型能力上。

2. 扎克伯格公开反对"减速论"

Meta CEO 扎克伯格近日公开表示:AI 实验室依靠独立评估者和顾问足以确保安全,不需要放缓开发;但同时他承认 Meta 因"安全和保障"主动推迟了 Muse AI 上市(每日经济新闻 9/17)。

这句话的潜台词是:大厂在监管口径上分裂了。Anthropic 喊减速、OpenAI 跟进披露异常行为、xAI 闷头冲 2.5 万亿、Meta 公开反对减速。企业不能再假设"行业会统一节奏"------你选的模型供应商,可能明年就因为安全事件被监管点名。

3. OpenAI 估值冲到 1.2 万亿美元

OpenAI 正就新一轮私募融资与投资者初步接触,拟定估值 1.2 万亿美元,较今年 3 月的 8520 亿美元大幅跃升(每日经济新闻 9/17)。

这个数字的意义不是"贵",而是资本已经在为"AGI 路线"定价 。如果 OpenAI、xAI 都按 AGI 估值,它们的 API 定价会长期维持高位------因为要支撑这个估值,必须证明单位调用能赚更多钱。这对企业的直接影响是:旗舰模型的价格战不会持续太久,现在是用低价锁合同、做迁移的窗口期。

四、企业选型:不是站队,是分层

我在过去 15 个企业级 AI 项目里反复验证一个结论:没有一家企业需要"只用最强模型",也没有一家能"只用最便宜模型"。合理的做法是三层模型架构:

层级 任务类型 推荐模型档 成本占比目标
L1 主力层 日常问答、文档处理、标准客服 Flash 级 / 百 B 自蒸馏 / 端侧小模型 60%-70% 调用量,<30% 成本
L2 专家层 复杂分析、代码生成、长文写作 百 B 旗舰 + 定向 SFT 20%-30% 调用量,~30% 成本
L3 旗舰层 架构设计、科研推理、疑难排障 最新旗舰(Grok/Astra/Opus 级) <5% 调用量,~40% 成本

关键工程动作:

  1. 先上路由模型。一个轻量分类器把任务分三档------这是昨天讲的"蚂蚁灵犀省 38.9% 成本"的核心。
  2. 给 L1 做 SFT 和蒸馏。把旗舰模型的输出沉淀成百 B 级专用模型,成本降一个数量级。
  3. L3 别自建,走 API。2.5 万亿参数级别的模型,自建推理没有任何经济性;跟签长期合同锁价。
  4. 盯内存和电力账单。显存涨 5-7 倍的环境下,自托管模型的 TCO 要把硬件涨价算进去。

五、Q&A

Q1:Grok 4.8 的 2.5 万亿参数是真的吗?能打过 GPT-5.6 吗?

2.5 万亿参数来自马斯克本人 X 平台帖,第三方尚未独立验证;Grok 4.6 在 Artificial Analysis 智能指数上是 61 分、与 GPT-5.6 持平,4.8 还在 RL 阶段,实际能力要等发布后第三方跑分。架构师现在不要替厂商做性能背书。

Q2:企业要不要等 Grok 4.8 发布后再做选型?

不要。Grok 4.8 即使本周完成预训练,从 RL、对齐、安全评估到 API 开放通常还要 2-4 个月。企业选型的时间窗比模型发布节奏快------现在该做的是把 L1/L2 层跑通,L3 层保留切换能力,不要被任何单一旗舰绑死。

Q3:参数路线和效率路线,哪个会赢?

我的判断是长期共存、按场景分层。AGI 级任务需要参数路线,但 95% 的企业业务不需要 AGI------效率路线在绝大多数场景的 ROI 更高。押注单一路线的企业,未来三年会被 TCO 教育。

Q4:内存涨 5-7 倍,对我们自托管模型有什么影响?

直接影响 TCO。HBM 和 DDR 涨价会推高推理服务器采购成本 20%-40%(以英特尔 CEO 陈立武表态为参照)。建议:高并发在线服务优先用云端托管(厂商承担硬件折旧),离线批量任务错峰跑;自托管只放在有长期稳定负载的场景。

六、给技术决策者的 3 条判断

  1. 不要被头条节奏带跑。Grok 4.8、Astra、Fable 这些旗舰发布是 CTO 层面的战略雷达,不是你这周要接入的产品。你的架构应该假设"任何旗舰模型每 6 个月迭代一次",保持可替换性。
  2. 把"模型分层"写进架构文档。L1/L2/L3 的调用比例、成本占比、路由规则,应该和数据库分库分表一样成为基础设施决策,而不是每个项目临时拍脑袋。
  3. 现在是锁低价合同的窗口。OpenAI 估值 1.2 万亿、xAI 冲 AGI------旗舰模型涨价是大概率事件;Flash 级低价也有保质期(缓存命中定价会随竞争格局调整)。批量任务、长上下文任务,优先签 6-12 个月的低价协议。

关于作者:AI 架构的深耕者,智能价值的转化者。11 年全栈 AI 架构与技术掌舵经验,立足架构设计与战略决策双视角,精通大模型全链路工程化部署,独握端侧 AI 软硬一体化核心技术。主导 15+ 企业级 AI 项目从蓝图到落地,累计创造超 2000 万合同价值,服务千万级用户与 500+ 企业。关注我,一起把前沿 AI 变成可落地的商业价值。

数据来源:马斯克 X 平台公开帖(2026-09-14/15);All-In Summit 现场发言(2026-09-15,洛杉矶);每日经济新闻《数智早参》(2026-09-17);东方财富网 OpenRouter 周支出数据(2026-09-16);36氪 DeepSeek V4.1 Flash 发布报道(2026-09-10);IT之家/TechWeb 关于 Grok 4.8 训练进度的综合报道。Grok 参数规模与对标关系均为马斯克本人表态,第三方尚未独立验证;价格与估值数字以官方公告为准。

本文基于 2026-09-17 可查证的公开信息撰写,不构成投资建议。

相关推荐
天涯明月19934 小时前
SGLang 设计与实现——RadixAttention 与前后端协同,让 KV 缓存不再用完即弃
人工智能·大模型·推理框架·ai infra
烛之武4 小时前
LangChain笔记
langchain·大模型·agent·mcp
爱上纯净的蓝天4 小时前
自包含推理一体机四层架构拆解:128G 统一内存、256K 上下文与实测口径
人工智能·大模型·私有化部署·agent·大模型部署
摞代码的猴哥4 小时前
RTX4060 8G 本地大模型测试
大模型·qwen3.6·rxt4060
Alice-YUE15 小时前
工业级 AI Agent 架构:5 层、2 范式、4 原则,一次讲透
面试·系统架构·大模型·ai agent·智能体
Raas10015 小时前
AI网关支持本地模型吗?MAI Gateway(魔芋企业级AI网关)实战能力深度解读
网关·大模型·ai网关·mai gateway·企业级产品
武雄(小星Ai)17 小时前
9月大模型超级发布周:GPT-6 Astra、Gemini 3.8 Flash等4款模型选型对比实录
ai·大模型·对比评测
程序猿编码18 小时前
不用 GPU!RK3588 跑视觉大模型,Qwen3.5-2B VLM 端侧落地
大模型·llm·rk3588·qwen·推理·vlm