インフラ基盤運用 GitHub、8 月 17 日の 7 時間半超の大規模障害について原因と対策を公表
月間コミット数が 29 億件へ倍増する中で中央米データセンターのインフラ容量不足が露呈し、Azure 移行と 300 万 CPU コア追加で対策を急ぐ。
リリース: 2026-08-20 · 読了 3 分記事の要約
1. 核心(What)
- 2026 年 8 月 17 日、GitHub は 7 時間 47 分に及ぶ大規模障害を発生させ、github.com や認証、Actions、Copilot などが世界中で停止した
- 中央米データセンターのトラフィック容量の枯渇が引き金となり、認証失敗からシステム全体のキャパシティプレッシャーへと波及した
- 復旧作業の過程で Copilot 関連のエラーがクライアント側のリトライループを誘発し、トラフィックが一時的に急増した
- 直近で月間コミット数が 14 億件から 29 億件へ急増したことが根本的な負荷の背景にあると CTO の Vladimir Fedorov 氏が説明した
2. 影響(Why)
- キャパシティ計画の限界露出: コード変更起因ではなく純粋なトラフィック急増によるインフラ破綻であり、急成長する開発プラットフォームにおける容量予測の難しさが浮き彫りになった。
- 国内開発組織への影響: 国内の CI/CD パイプラインを GitHub Actions に一元化しているチームは、プラットフォーム側の障害が自社リリースを直撃するリスクを運用設計に組み込む必要がある。
3. 根拠・詳細(How)
- Azure 移行とハードウェア増強: Azure が GitHub プラットフォーム負荷の 58% を処理し、300 万超の CPU コアと 120PB の高速ストレージを既存データセンターに追加して物理容量を底上げした。
- リトライ制御の厳格化: サービス間通信において一貫したリトライリミット、リトライバジェット、可変タイムアウトを適用し、リカバリ時の再試行嵐を防ぐ仕組みを導入した。
4. 展望・課題(Next)
- モノレポの読み取り容量無制限化: リーダー数に比例して読み取り容量が線形にスケールする新しいアーキテクチャを最大規模のモノレポから順次ロールアウトする予定である。
- 依存関係の分離とアラート改善: クリティカルシステムの分離を進めて影響範囲を狭めるとともに、トラフィック急増時に失敗する低優先度コンポーネントのアラート見直しを実施する。