OpenAI多项服务突发大规模宕机

2026年7月25日,OpenAI旗下多项核心服务出现大规模故障,受影响范围涵盖ChatGPT、Codex、API v4.2及企业级Assistant Pro。此次服务中断横跨北美、欧洲、亚太三大时区。网络监控平台DownDetector记录显示,全球OpenAI宕机报告大幅飙升,峰值告警量突破127万次/小时,创该平台2026年度单日最高纪录,该数值比今年4月微软Azure大规模中断高出3.2倍。

OpenAI官方状态页确认,此次事故涉及15项ChatGPT组件、12项API组件及4项Codex组件,共计31项服务组件出现性能下降。用户在故障期间遇到登录失败、认证错误、历史记录消失、会话中断或请求失败等现象,免费用户与付费Plus用户均受到影响。

故障原因分析与恢复情况

OpenAI于美国太平洋时间7月25日凌晨2时17分发布公告,表示正在调查服务错误率升高的问题。相关服务已于美国太平洋时间7月25日凌晨4时08分全部恢复,此次故障持续时间约为1小时51分钟。

关于故障原因,多位匿名OpenAI基础设施工程师向IT之家透露,此次故障源于7月24日晚间的一次“非预期级联扩容”。为了支撑即将上线的多模态推理引擎“Orion-7”,团队在旧有Kubernetes集群中部署了新型异构计算调度模块,导致新调度器与存量GPU拓扑识别逻辑发生“语义冲突”。在18分钟内,负载均衡器循环重试、缓存层穿透及LLM推理队列堆积,最终导致服务网格坍塌。

此外,行业观察与用户推测认为,可能原因还包括用户增长与算力扩容不匹配、服务器配置或软件更新问题(如7月23日曾经历一次近24小时故障)、外部攻击或流量异常,以及MoE等模型架构在高并发下的负载分配短板。

社会影响与行业挑战

此次宕机发生在AI行业忙碌的“夏季交付季”。据统计,2026年Q3全球已有超4100家科技公司将ChatGPT集成至CRM、HRIS和自动化审计系统;在教育领域,教育部备案的“AI助教计划”覆盖全国2.8万所中小学。大量依赖AI进行工作、学习或代码调试的用户在故障期间被迫“停摆”。

业内分析指出,此次事件反映出算力基础设施难以跟上用户爆发式增长的共同挑战,不仅是OpenAI,DeepSeek、腾讯WorkBuddy等平台也曾出现服务中断。