17 августа GitHub пережил крупный сбой длительностью 7 часов 47 минут, нарушив работу таких сервисов, как github.com, GitHub Actions, API и Copilot. Это была вторая значительная инцидент в августе, после сбоя в Actions 6 августа. Сбой возник из-за того, что критически важный компонент инфраструктуры в центре обработки данных GitHub в Центральном США не смог масштабироваться во время пикового трафика, что привело к каскадным сбоям в нескольких сервисах.
Расследование GitHub показало, что оба инцидента были связаны с недостатком ёмкости, а не с изменениями в коде или конфигурации. Ежемесячные коммиты выросли с 1,4 миллиарда до 2,9 миллиардов с апреля, создавая беспрецедентное давление на систему. Восстановление потребовало согласованных усилий по перенаправлению трафика, изоляции затронутой инфраструктуры и поэтапному восстановлению сервисов.
С апреля GitHub добавил более 3 миллионов процессорных ядер, 120 петабайт хранилища и значительную сетевую пропускную способность, ускорив миграцию на Azure. Azure теперь обрабатывает около 58% нагрузки платформы GitHub. Компания внедряет единые ограничения повторных попыток, улучшает тестирование и изолирует критически важные системы для предотвращения будущих сбоев.
Написано Владимиром Федоровым, CTO GitHub, статья подчёркивает приверженность компании к надёжности через архитектурные улучшения и операционные изменения.
Источник: Hacker News · Сводку подготовил HeadlinesBriefing