HeadlinesBriefing HeadlinesBriefing.com

GitHub-Ausfall 17. August: Wiederherstellungsplan

Hacker News •
×

Am 17. August erlebte GitHub einen größeren Ausfall von 7 Stunden und 47 Minuten, der Dienste wie github.com, GitHub Actions, APIs und Copilot betraf. Dies war der zweite bedeutende Vorfall im August, gefolgt von einem Fehler in den Aktionen am 6. August. Der Ausfall wurde verursacht, weil eine kritische Infrastrukturkomponente im US-Zentrale Rechenzentrum von GitHub während des Spitzenverkehrs nicht skaliert werden konnte, was zu kaskadenartigen Ausfällen in mehreren Diensten führte.

Die Untersuchung durch GitHub ergab, dass beide Vorfälle Kapazitätsausfälle waren und nicht durch Code- oder Konfigurationsänderungen verursacht wurden. Die monatlichen Commits stiegen von 1,4 Milliarden auf 2,9 Milliarden seit April, was einen beispiellosen Druck auf das System erzeugte. Die Wiederherstellung erforderte koordinierte Anstrengungen, um den Verkehr umzuleiten, betroffene Infrastruktur zu isolieren und die Dienste schrittweise wiederherzustellen.

Seit April hat GitHub mehr als 3 Millionen CPU-Kerne, 120 Petabyte Speicher und erhebliche Netzwerkkapazität hinzugefügt und die Azure-Migration beschleunigt. Azure verarbeitet nun etwa 58 % der Plattformlast von GitHub. Das Unternehmen implementiert einheitliche Retry-Grenzen, verbessert die Tests und isoliert kritische Systeme, um zukünftige Ausfälle zu verhindern.

Von Vladimir Fedorov, CTO von GitHub, verfasst, betont der Beitrag das Engagement des Unternehmens für Zuverlässigkeit durch architektonische Verbesserungen und operative Änderungen.

Quelle: Hacker News · Zusammengefasst von HeadlinesBriefing