HeadlinesBriefing HeadlinesBriefing.com

GitHub 8月17日障害復旧計画

Hacker News •
×

8月17日、GitHubは7時間47分間の大規模障害を経験しました。この障害により、github.com、GitHub Actions、API、Copilotを含む複数のサービスが停止しました。これは8月の2番目の重大事象であり、先に8月6日にアクションの障害が発生していました。障害の原因は、GitHubの中央米国データセンターにある重要なインフラストラクチャコンポーネントがピーク時のトラフィックに対応できなかったことで、複数のサービスにカスケード障害を引き起こしました。

GitHubの調査によると、これら2つの事象は容量の障害であり、コードや設定の変更によるものではありませんでした。4月以来、月間コミット数は14億から29億に増加し、システムに前例のない圧力をかけました。復旧にはトラフィックのルーティング、影響を受けたインフラストラクチャの分離、サービスの段階的な復元を行うための調整された努力が必要でした。

4月以来、GitHubは300万以上のCPUコア、120ペタバイトのストレージ、および大幅なネットワーク容量を追加し、Azureの移行を加速しています。Azureは現在、GitHubプラットフォームの負荷の約58%を処理しています。同社は一貫した再試行制限を実装し、テストを改善し、将来の障害を防ぐために重要なシステムを分離しています。

GitHubのCTOであるVladimir Fedorovによって執筆されたこの投稿は、アーキテクチャの改善と運用の変更を通じて信頼性を確保するという会社のコミットメントを強調しています。

主要エンティティ:企業:GitHub、Azure、Meta、Microsoft、User Clouds、Codepath.org | 人物:Vladimir Fedorov | 場所:中央米国、サンフランシスコ、ベイエリア

出典: Hacker News · 要約:HeadlinesBriefing