从GPT-5.6 Sol的Ultrafast模式看推理速度竞赛:750 token/秒背后,Cerebras的晶圆级生意

从GPT-5.6 Sol的Ultrafast模式看推理速度竞赛:750 token/秒背后,Cerebras的晶圆级生意

同一颗大模型,输出速度一夜之间变成原来的14倍------8月13日晚,OpenAI与Cerebras联合宣布推出GPT-5.6 Sol的Ultrafast极速推理模式,有限预览开放。速度数字本身已经够刺激:最高750 token/秒,约为标准处理速度的14倍。但比速度更值得拆解的,是支撑这场提速的硬件故事------一家营收翻倍却亏损扩大的晶圆级芯片公司,为什么正在成为大模型推理速度竞赛的主角。

先把新闻锚点对齐。8月13日晚,OpenAI与Cerebras联合推出GPT-5.6 Sol的Ultrafast模式并开放有限预览,该模式由Cerebras晶圆级硬件驱动,输出速度最高750 token/秒,约为标准处理速度的14倍。与此同时,Cerebras公布2026财年Q2财报:核心营收2.098亿美元、同比增长103%;其中云与服务收入1.277亿美元、同比增长287%;硬件收入8210万美元、同比增长17%;但每股净亏损2.98美元,超出分析师预期1.31美元,盘后股价一度跌逾16%;公司在手RPO(剩余履约义务)订单254亿美元,并上调全年指引。

一、推理速度为什么突然成了"硬通货"

两年前,大模型竞赛的焦点是训练------谁能训出更强的模型;现在,焦点正在转向推理------谁能让模型在用户面前响应得更快。

速度的含金量来自三个层面。第一是体验层:750 token/秒意味着一个500字的段落几乎"秒出",对话不再有等待感,用户对"AI是否好用"的体感会发生质变。第二是应用层:实时语音、代码补全、Agent自主执行这些场景,对延迟极其敏感------Agent每多等一秒,多轮任务的完成时间就成倍放大,速度直接决定Agent能不能"跑起来像真人"。第三是经济学层:推理越快,单位时间处理的任务越多,同样的算力成本可以服务更多用户;对按token收费的API生意而言,速度就是单位成本的分母。

层面 速度的价值 典型场景
体验层 消除等待感、体感质变 对话、写作助手
应用层 支撑实时多轮任务 语音、代码补全、Agent
经济学层 摊薄单token成本 API服务、批量任务

所以,当OpenAI选择把Ultrafast模式与Cerebras绑定,行业读出的信号很明确:速度本身已经成为旗舰模型商业化的核心卖点之一,而实现它的硬件路径,正在从英伟达GPU的既定轨道上分叉。

二、晶圆级引擎是什么:一整片晶圆,就是一颗芯片

Ultrafast的底牌是Cerebras的晶圆级引擎(WSE)。理解它,需要先理解传统芯片的"切片"逻辑。

常规的GPU/加速芯片,是把一整片硅晶圆切成几十上百颗小芯片,每颗独立封装、再通过外部高速接口互联。问题在于:芯片之间的数据传输速度远低于芯片内部,大模型推理恰恰是数据搬运密集型的活------模型权重要在内存和计算单元之间反复流动,跨芯片通信就成了瓶颈。

晶圆级引擎的思路是反着来:不做切片,把一整片晶圆直接做成一颗巨大的芯片。好处是显而易见的------片上存储(SRAM)容量巨大且带宽极高,模型权重可以整个放在芯片上,不用反复访问外部内存,推理速度因此大幅提升;代价也同样明显:整片晶圆只要有一个坏点,整颗芯片就报废,良率挑战巨大,这也是晶圆级路线几十年无人真正商业化的原因。

对比维度 传统GPU方案 晶圆级引擎方案
芯片形态 晶圆切成多颗小芯片 整片晶圆做一颗芯片
数据搬运 跨芯片互联,慢 全在片上,快
内存瓶颈 HBM带宽受限 片上SRAM,带宽极高
良率与成本 成熟可控 挑战大、门槛高

Cerebras的差异化在于:它绕开了主流玩家围绕HBM(高带宽内存)展开的军备竞赛,用"超大芯片+超大片上存储"的路线,在大模型推理这个场景上,打出了别人短时间追不上的速度优势。

三、营收翻倍、亏损扩大:财报里的"速度生意"两面

Ultrafast发布同日,Cerebras的财报把这家公司的商业模式摊开了:增长速度惊人,但亏损同样惊人。

核心营收同比增长103%,其中云与服务收入同比大增287%------云服务已经成为绝对主力,说明客户更多是在"租算力"而非"买芯片"。硬件收入只增长17%,增速明显低于云,印证了商业模式从卖硬件向卖服务的转型。另一边,每股净亏损2.98美元、超分析师预期1.31美元,盘后股价一度跌逾16%------市场对"增长换亏损"的定价,依然很严厉。

但财报里最值得注意的数字是RPO:254亿美元的在手订单。这意味着未来数年的大额算力合同已经锁定,市场对晶圆级算力的需求是真实存在的。用一句话概括这家公司的处境:用当下的巨额亏损,赌一个已经被订单部分验证的未来。

指标 2026财年Q2 同比变化 信号
核心营收 2.098亿美元 +103% 高速增长
云与服务收入 1.277亿美元 +287% 商业模式转向服务
硬件收入 8210万美元 +17% 硬件销售放缓
每股净亏损 2.98美元 超预期1.31美元 亏损扩大
在手RPO订单 254亿美元 --- 未来数年需求锁定

四、推理速度竞赛的三条路线

Ultrafast不是孤立事件。把视角拉高,当前推理速度竞赛正沿着三条路线同时推进。

第一条是英伟达主导的GPU集群路线:继续堆大模型集群的算力密度与互联带宽,靠规模与生态取胜。这是最成熟也最主流的路线,但HBM供应紧张、集群功耗与成本高企,让"堆出来"的边际收益在下降。第二条是专用推理芯片路线:为推理场景定制架构,在特定模型和任务上做到极致性价比,典型代表是各家自研的推理加速器。第三条就是晶圆级路线:用超大单芯片和片上存储,直接改变数据搬运的游戏规则,目前玩家稀少、门槛极高,但速度优势显著。

三条路线各有拥趸,而OpenAI的这次合作相当于给晶圆级路线投下了一张重量级信任票:当旗舰模型的供应商主动选择非英伟达的推理硬件,说明速度竞争已经激烈到"英伟达的默认选项不够用"的地步。

路线 代表 优势 短板
GPU集群 英伟达生态 成熟、生态全 HBM紧张、功耗高
专用推理芯片 各家自研加速器 性价比高 通用性有限
晶圆级引擎 Cerebras 速度极致、带宽大 良率难、玩家少

五、对从业者意味着什么:三个判断

推理速度竞赛加速,对科技从业者至少有三个实质影响。

其一,选型逻辑要加上"速度维度"。过去选模型看能力、看价格,现在还要看速度与延迟------同样能力的模型,响应速度差一个数量级,应用体验和成本结构就完全不同。Ultrafast这类模式的开放,意味着"速度"正在成为可采购的差异化服务。

其二,推理成本结构将被重估。速度提升14倍,如果单价不按同比例上涨,单位任务的推理成本就大幅下降------这对Agent类、批处理类应用的商业模式是实质利好。反过来,对按推理时长计费的云厂商,这也是一个需要重新定价的信号。

其三,英伟达的"默认选项"地位首次被实质性挑战。OpenAI与Cerebras的绑定,加上晶圆级硬件进入旗舰模型供应链,标志着推理硬件市场从一家独大走向多路线竞争。对算力采购者而言,这长期是好事:多一个可选的供给路线,就多一分议价空间。

六、接下来盯什么

Ultrafast模式目前只是有限预览,未来几周有三个节点值得跟踪。一是正式放量与定价:750 token/秒的速度能否规模化交付、价格如何设定,将直接决定这条路线能不能从"炫技"变成"生意"。二是Cerebras的产能与良率爬坡:254亿美元订单的履约进度,是晶圆级路线最大的不确定性。三是英伟达的回应:面对推理速度的正面竞争,GPU阵营会降价、提速,还是推出针对性产品------这轮攻防,将决定未来两年推理算力市场的格局。

750 token/秒是速度的起点,不是终点。当推理速度成为旗舰模型的卖点,算力市场的下一个十年,恐怕已经从"比谁算得快"悄悄变成了"比谁搬得快"。

相关推荐
leisoo80971 小时前
财报数据怎么排雷本地化Python构建财务异常预警系统
人工智能·python·算法
小柯南敲键盘2 小时前
跨马翻译:跨境电商批量图片翻译与视频字幕一站式工具
人工智能·python·音视频
微硬创新2 小时前
老旧产线改造:耐达讯自动化16路4‑20mA转PROFINET的工程实践
人工智能·网络协议·自动化·信息与通信
卷无止境2 小时前
FastAPI Guard 全解析,从概念到工程落地的实战指南
后端·python
卷无止境2 小时前
FastAPI Users 全面解析:概念、原理与工程实战
后端·python
HiDev_3 小时前
【非标自动化】2、认识元器件(固态继电器)
运维·自动化
明达智控技术3 小时前
国产 PLC 落地立库自动化,MC5000边缘智能控制器破局
运维·自动化
COOLMO研究AI3 小时前
Python 如何在 AI 接口中实现请求幂等性:防止重复提交与重复扣费
人工智能·python·php
CTA量化套保3 小时前
新手学量化,先做能复查的小流程
人工智能·python