HeadlinesBriefing HeadlinesBriefing.com

GitHub 8月17日宕机恢复计划

Hacker News •
×

8月17日,GitHub遭遇长达7小时47分钟的重大宕机,影响包括github.com、GitHub Actions、API以及Copilot在内的多项服务。这是8月的第二次重大事件,此前8月6日曾发生Actions故障。宕机原因是GitHub中央美国数据中心的一个关键基础设施组件在高峰流量期间无法扩展,导致多个服务出现级联故障。

GitHub的调查显示,这两起事件均为容量故障,而非代码或配置变更所致。自4月以来,每月提交量从14亿增长到29亿,给系统带来前所未有的压力。恢复工作需要协调 rerouting 流量、隔离受影响的基础设施并分阶段恢复服务。

自4月以来,GitHub已添加超过300万个CPU核心、120PB的存储空间以及显著的网络容量,并加速了Azure迁移。Azure现在处理约58%的GitHub平台负载。公司正在实施一致的重试限制,改进测试工作,并隔离关键系统以防止未来宕机。

由GitHub首席技术官Vladimir Fedorov撰写的文章强调了公司通过架构改进和运营变更来保障可靠性的承诺。

关键实体:公司:GitHub、Azure、Meta、Microsoft、User Clouds、Codepath.org | 人物:Vladimir Fedorov | 地点:中央美国、旧金山、湾区

来源: Hacker News · 由HeadlinesBriefing整理摘要