9月3日、主要な人工知能サービス3つで一部時間帯が重なる障害が発生し、一部のユーザーにとってChatGPT、Claude、Grokが一時的に利用不能、または不安定になった。発生時期から、共通インフラに関する当然の疑問が浮上したものの、各社の公式説明では共通する障害原因は示されなかった。
OpenAIによると、太平洋時間午前7時43分ごろにルーティングエラーが始まり、各プラットフォームのChatGPTとCodexに影響した。同社の広報担当者はWiredに対し、午前8時17分ごろに解決策を導入し、その後も監視を続けたと述べた。この説明は、特定のクラウド事業者やコンテンツ配信事業者の障害ではなく、社内ネットワークの問題を示すものだった。
Anthropicは太平洋時間午前6時23分、Claude Mythos 5.1、Claude Fable 5.1、Claude Opus 5に関連するリクエストエラーの増加を挙げ、部分的な障害の報告を開始した。同社はその後、原因を特定して修正を導入したと述べ、午前9時16分までに障害を解決済みとした。報道によると、午前9時を少し過ぎたころには、別の短時間の問題がClaude Sonnet 5に影響したとみられる。Anthropicは、この件についてWiredへの追加コメントを控えた。
XAIのステータスページは太平洋時間午前6時30分、同社のプラットフォームとサービス全体でGrokに障害が発生しているとの説明を開始した。午前10時5分に障害対応は完了とされ、その時点で同社はトラフィックが再び正常になったと発表した。xAIの親会社であるSpaceXは後に、Grokの問題はメンフィスのコンピュートセンターでの障害が原因だったと説明し、影響を受けたコンピューティングパートナーに謝罪した。
発生時期が近かったため、当初は共通の供給事業者が原因である可能性が考えられた。大規模AIシステムは、クラウドコンピューティング、ネットワーク、認証、コンテンツ配信など、互いに重なる複数の層に依存しており、広く利用されている事業者の一つで問題が起きれば、本来は別個の製品にも影響し得る。しかし、OpenAIとAnthropicは外部の依存先を原因として挙げなかった。Wiredによると、Cloudflare、Amazon Web Services、Microsoft Azureを含む大手インフラ企業も、これに対応する障害を報告していなかった。
GoogleのGeminiサービスにも問題が発生した可能性を示す報告が散発的にあったが、Googleは障害を確認しておらず、公開ステータスダッシュボードにも記録はなかった。そのため、実際に関連する障害だったのか、注目度の高いサービス障害には付き物の通常範囲のユーザー報告だったのかを区別することは難しい。
したがって、現時点の証拠が裏付けているのは、業界全体に及ぶ一つの障害が実証されたということではなく、複数の障害が同時に発生したという見方だ。OpenAIはルーティングを原因として特定し、xAIはコンピュートセンターの障害を挙げた一方、Anthropicが明らかにしたのは、原因を突き止めて修正を適用したということだけだった。各社のサービスが似た時間帯に停止した事実は依然として注目に値するが、単なる偶然だけでは、共通インフラの利用や連携した活動があったことの証明にはならない。
開発、顧客サービス、研究のワークフローにAIアシスタントを組み込む企業が増えるなか、今回の出来事は、モデルの可用性が業務上の依存要素であることを改めて示している。事業者をまたいだ冗長化は有効かもしれないが、それは、それらの事業者が同じ非公開のサービスに依存していない場合に限られる。より詳細な障害報告がなければ、顧客は現時点で、これらのシステムが実際にどの程度独立しているのかを判断できない。



