新聞
新聞

OpenAI 的「黑屏週」:ChatGPT 和 Sora 服務中斷暴露了雲端平台的脆弱核心

2025-06-17 1074


10年2025月XNUMX日,一場毀滅性的技術故障讓OpenAI陷入混亂:ChatGPT和Sora同時崩潰。數小時之內,全球數百萬人的AI工作流程突然中斷──作家、程式設計師、研究人員和企業都陷入癱瘓。這絕非普通的故障;它清楚地提醒我們,即使是人工智慧的巨頭,其根基也同樣脆弱。

此次宕機事件波及全球,使用者無法存取網頁、應用程式和桌面介面。 OpenAI 的狀態頁面確認發生了“重大中斷”,影響了所有 ChatGPT 用戶——儘管 API 服務仍在運行——但並未給出明確的崩潰原因。隨著時間的推移,用戶沮喪之情與日俱增。一位用戶在 X 平台上的抗議引起了廣泛共鳴:
這給我們敲響了警鐘。在產品發布或客戶危機期間遺失關鍵工具?後果不堪設想。
總停機時間接近8小時——OpenAI 90 天內持續時間最長、最嚴重的故障。

骨牌效應:一朵雲倒下,眾多服務隨之而來

隨著 ChatGPT 的凍結,一場可預見的混亂開始了:用戶紛紛湧向谷歌的 Gemini 和 Anthropic 的 Claude 等替代方案。搜尋 雙子座飆升近60%,達到了 372,000 次查詢——這充分證明了它作為 ChatGPT 頂級備份的地位。但這種緩解並沒有持續太久。
幾個小時之內,Gemini、Claude 和 Perplexity 就不堪重負,流量激增。 Claude 顯示伺服器錯誤;Perplexity 承認:「我們超出了容量。」一位觀察員一針見血地指出了這一點:

“就像多米諾骨牌一樣——一片雲破裂,其他雲也會在重壓下倒塌。”
這並不是什麼新鮮事。就在幾天前,13月XNUMX日, Google Cloud 的 IAM 故障 類似的事件也導致 OpenAI、Shopify 以及全球支付系統癱瘓了 3 個多小時。教訓是什麼?中心化的雲端基礎設施是現代網路的單點故障點。


為什麼一次中斷會「摧毀」人工智慧世界?

1. 集中雲的脆弱主幹
與大多數人工智慧巨頭一樣,OpenAI 也運行在 Google Cloud 等超大規模雲端平台上。一旦其身分管理 (IAM) 或負載平衡系統發生故障,API 就會癱瘓,最終導致下游系統崩潰。儘管 OpenAI 承諾“99.99% 的正常運行時間”,但其複雜性也帶來了潛在的漏洞。

2. 冗餘的錯覺
即使公司採用多雲策略(例如 OpenAI + Google Cloud + Azure),與單一供應商的深度整合也會在故障轉移期間造成延遲。正如一位工程師打趣道:

“我們以為‘雲’就是天空。結果發現它只是別人的天花板。” 

3. 社會對人工智慧的依賴日益加深
從程式設計到內容創作, 1.8億用戶現在依賴ChatGPT 每天都如此。一旦它消失,生產力就會直線下降。我們用彈性換取了便利——而斷電卻帶來了沉重的代價。


不僅僅是一個小故障:OpenAI 的系統性挑戰

此次中斷暴露了基礎設施以外的漏洞:

  • 數據和人才短缺:GPT-5 開發缺乏高品質數據,關鍵科學家流失

  • 合成數據故障:用於抵消稀缺的真實數據,存在「獎勵駭客」和不穩定輸出的風險

  • 安全盲點:過去的中斷涉及 DDoS 攻擊,但防禦措施仍然處於被動狀態

愛德華齊特龍 (Edward Zitron) 等批評人士警告稱,生成人工智慧的「不可持續的泡沫」可能會破裂,導致科技巨頭過度曝光,公眾失去信任。


OpenAI 和業界如何應對

OpenAI的舉動:

  • 成立“準備小組”,以應對網路威脅等“災難性風險”

  • 有爭議的開源模式(Sam Altman: “我們在開源問題上犯了錯誤”

  • 升級其「審議一致性」框架,將安全性嵌入模型推理中

產業轉變:

  • 多雲混合設定:避免供應商鎖定以度過單一供應商崩潰

  • 邊緣計算:在本地處理資料以減少對雲端的依賴

  • 更嚴格的監管:歐盟《人工智慧法案》現對服務中斷的公司處以最高相當於其全球收入 7% 的罰款


防範未來停電:前進的三條路

  1. 失敗的建築師:將雲端視為易出錯的設計應用程序,並具有即時多雲故障轉移功能。

  2. 重拾基本技能:正如人工智慧倫理學家所呼籲的,避免過度依賴。如果ChatGPT消失了,你還能工作嗎?

  3. 要求透明度:推動 OpenAI 等供應商揭露正常運行時間日誌和復原計劃,否則將面臨法律訴訟(例如 Shopify 在 Google Cloud 崩潰後採取的法律行動)。

10 月 XNUMX 日的停電並非小插曲——這是對我們這個依賴人工智慧的時代的壓力測試隨著中斷成本越來越高,影響範圍越來越廣,恢復能力已刻不容緩。支撐人工智慧的雲層本身必須牢不可破。