OpenAI 的“黑屏周”:ChatGPT 和 Sora 服务中断暴露了云平台的脆弱核心

2025-06-17 1074


10年2025月XNUMX日,一场毁灭性的技术故障让OpenAI陷入混乱:ChatGPT和Sora同时崩溃。数小时之内,全球数百万人的AI工作流程突然中断——作家、程序员、研究人员和企业都陷入瘫痪。这绝非普通的故障;它清晰地提醒我们,即使是人工智能的巨头,其根基也同样脆弱。

此次宕机事件波及全球,用户无法访问网页、应用和桌面界面。OpenAI 的状态页面确认发生了“重大中断”,影响了所有 ChatGPT 用户——尽管 API 服务仍在运行——但并未给出明确的崩溃原因。随着时间的推移,用户沮丧之情与日俱增。一位用户在 X 平台上的抗议引起了广泛共鸣:
这给我们敲响了警钟。在产品发布或客户危机期间丢失关键工具?后果不堪设想。
总停机时间接近8小时——OpenAI 90 天内持续时间最长、最严重的故障。

多米诺骨牌效应:一朵云倒下,众多服务随之而来

随着 ChatGPT 的冻结,一场可预见的混乱开始了:用户纷纷涌向谷歌的 Gemini 和 Anthropic 的 Claude 等替代方案。搜索 双子座飙升近60%,达到了 372,000 次查询——这充分证明了它作为 ChatGPT 顶级备份的地位。但这种缓解并没有持续太久。
几个小时之内,Gemini、Claude 和 Perplexity 就不堪重负,流量激增。Claude 显示服务器错误;Perplexity 承认:“我们超出了容量。” 一位观察员一针见血地指出了这一点:

“就像多米诺骨牌一样——一片云破裂,其他云也会在重压下倒塌。”
这并不是什么新鲜事。就在几天前,13月XNUMX日, Google Cloud 的 IAM 故障 类似的事件也导致 OpenAI、Shopify 以及全球支付系统瘫痪了 3 个多小时。教训是什么?中心化的云基础设施是现代网络的单点故障点。


为什么一次中断会“摧毁”人工智能世界?

1. 集中云层的脆弱主干
与大多数人工智能巨头一样,OpenAI 也运行在 Google Cloud 等超大规模云平台上。一旦其身份管理 (IAM) 或负载均衡系统出现故障,API 就会瘫痪,最终导致下游系统崩溃。尽管 OpenAI 承诺“99.99% 的正常运行时间”,但其复杂性也带来了潜在的漏洞。

2. 冗余的错觉
即使公司采用多云策略(例如 OpenAI + Google Cloud + Azure),与单一提供商的深度集成也会在故障转移期间造成延迟。正如一位工程师打趣道:

“我们以为‘云’就是天空。结果发现它只是别人的天花板。” 

3. 社会对人工智能的依赖日益加深
从编码到内容创作, 1.8亿用户现在依赖ChatGPT 每天都如此。一旦它消失,生产力就会直线下降。我们用弹性换取了便利——而断电却带来了沉重的代价。


不仅仅是一个小故障:OpenAI 的系统性挑战

此次中断暴露了基础设施之外的漏洞:

  • 数据和人才短缺:GPT-5 开发缺乏高质量数据,关键科学家流失

  • 合成数据故障:用于抵消稀缺的真实数据,存在“奖励黑客”和不稳定输出的风险

  • 安全盲区:过去的中断涉及 DDoS 攻击,但防御措施仍然处于被动状态

爱德华·齐特龙 (Edward Zitron) 等批评人士警告称,生成人工智能的“不可持续的泡沫”可能会破裂,导致科技巨头过度曝光,公众失去信任。


OpenAI 和业界如何应对

OpenAI的举动:

  • 成立“准备小组”,应对网络威胁等“灾难性风险”

  • 有争议的开源模式(Sam Altman: “我们在开源问题上犯了错误”

  • 升级其“审议一致性”框架,将安全性嵌入模型推理中

产业转移:

  • 多云混合设置:避免供应商锁定以度过单一供应商崩溃

  • 边缘计算:在本地处理数据以减少对云的依赖

  • 更严格的监管:欧盟《人工智能法案》现对服务中断的公司处以最高相当于其全球收入 7% 的罚款


防范未来停电:前进的三条道路

  1. 失败的建筑师:将云视为易出错的设计应用程序,并具有即时多云故障转移功能。

  2. 重拾基本技能:正如人工智能伦理学家所呼吁的,避免过度依赖。如果ChatGPT消失了,你还能工作吗?

  3. 要求透明度:推动 OpenAI 等提供商披露正常运行时间日志和恢复计划,否则将面临法律诉讼(例如 Shopify 在 Google Cloud 崩溃后采取的法律行动)。

10 月 XNUMX 日的停电并非小插曲——这是对我们这个依赖人工智能的时代的一次压力测试随着中断成本越来越高,影响范围越来越广,恢复能力已刻不容缓。支撑人工智能的云层本身必须牢不可破。