- 作者:陈大鱼头
- github:github.com/KRISACHAN
- 邮箱:chenjinwen77@gmail.com
发现故障
晚上正在使用 GPT 的时候发现不可用了,然后鱼头在重启电脑 N 次之后终于意识到可能是它挂了,就去查这到底是为什么,在查的过程中发现不仅仅是 GPT,连 Claude,Grok 都挂了。



时间线
我找 Gemini 输出了一份时间线说明(截止到写稿时):
-
21:00|初始源头:OpenAI 核心网关与调度链路异常
OpenAI 北美主可用区突发网络配置漂移或 BGP 路由抖动,导致反向代理层连接池耗尽。全球 Web 端大面积出现 502/504 超时,API 响应吞吐急剧跌落,监控大盘首现异常告警。
-
21:08|流量重定向:全球并发无缓冲涌入 Claude
依赖多模型主备切换的自动化脚本、企业开发管线以及突发中断的全球用户,在数秒内迅速向 Anthropic 切换。流量洪峰在未经预热的情况下呈数量级激增。
-
21:17|次生过载:Anthropic 调度层与限流队列击穿
Claude 的接入网关遭遇超量瞬时脉冲(Traffic Spike),分布式任务调度与推理实例池排队超限,触发级联熔断,官方状态页开始密集报错"Capacity / Overloaded"。
-
21:26|终极分流:xAI / Grok 承接外溢负载后失陷
前两大模型厂商相继瘫痪后,残余流量全面外溢至 Grok。伴随社交平台讨论热度飙升带来的即时访问压力,xAI 的鉴权服务与推理集群在双重过载下发生服务降级与连接中断。
-
21:40|全域瘫痪:上游网络拥塞与客户端恶性重试
三家服务相继下线,客户端自动化脚本与人工刷新发起海量无限重试,引发分布式"自伤型"拒绝服务(Self-inflicted DDoS)。全球各大模型状态页面全线飘红,服务陷入大面积停摆。
可能原因
Gemini 说三家在极短时间窗口内集体失联,核心诱因可归结为以下四类:
公共基础设施单点故障
- 骨干网与 CDN / DNS 瘫痪:Cloudflare、Fastly 等全球边缘节点发生 BGP 路由震荡或 DNS 解析崩溃,导致前端入口全阻断。
- 公有云核心可用区失陷:三家反向代理或关键控制面若高度重叠部署于同一底层数据中心(如 AWS us-east-1),机房电力或物理网络故障将导致批量离线。
无预热流量转移(级联雪崩)
- 瞬时洪峰踩踏:某一家突发故障后,全球数千万用户、自动化工作流及跨模型容灾脚本毫秒级切流,数倍超载流量依次打穿后续厂商的限流与调度队列。
- 重试风暴放大:客户端不断激进化重试,叠加鉴权服务锁死,诱发全网范围的"自伤型" DDoS。
底层软件供应链与公共依赖缺陷
- 通用推理底座漏洞:共用的开源底层组件(如 vLLM、Triton、NCCL 分布式通信库)触发特定死锁逻辑或内存泄漏。
- 安全证书与内容合规链路熔断:根证书异常失效,或通用的内容安全审查接口挂起,导致下游推理生成全链路强制阻断。
外部网络安全攻击
- 协同分布式拒绝服务(DDoS):针对 AI 头部厂商接入层发起的大规模协同流量清洗压迫。
- 零日(0-Day)协议攻击:针对主流 API 协议规范或 HTTP/2、QUIC 网关实现的通用漏洞突击利用。
集体吃瓜
在写稿时朋友圈基本都在讨论此事。
这让鱼头想起了中学时期晚自习停电,然后大家提前放学的场景。
准备发文的时候据说已经恢复了,发完文鱼头得赶紧去看看是不是可用了。
不知道这次事件对大家有什么影响,欢迎在评论区留言你的感受。