في 17 أغسطس، عانت GitHub من انقطاع طويل 7 ساعات و47 دقيقة، أثر على خدمات مثل github.com، GitHub Actions، واجهات برمجية، وCopilot. كانت هذه الحادثة الثانية الهامة في أغسطس، تليها فشل في الإجراءات في 6 أغسطس. ناتج الانقطاع فشل مكوّن حاسم في بنية تحتية في مركز بيانات GitHub الأمريكي المركزي في التوسع أثناء ذروة الحركة المرورية، مما أدى إلى فشول متدلية عبر خدمات متعددة.
كشفت تحقيقات GitHub أن كلا الحادثتين كانتا فشولاً في السعة، وليسا ناتجتين عن تغييرات في الكود أو الإعدادات. نمت الحجات الشهرية من 1.4 مليار إلى 2.9 مليار منذ أبريل، مما خلق ضغطاً غير مسبوق على النظام. استغرت الاستعادة جهوداً منسقة لإعادة توجيه حركة المرور، وعزل البنية التحتية المتأثرة، واستعادة الخدمات على مراحل.
منذ أبريل، أضافت GitHub أكثر من 3 ملايين نواة معالج، و120 بيتابايت من التخزين، وسعة شبكة كبيرة، وتسارعت في عملية الترحيل إلى Azure. يتحمل Azure الآن حوالي 58% من حمل منصة GitHub. تقوم الشركة بتنفيذ حدود إعادة محاولة موحدة، وتحسين الاختبارات، وعزل الأنظمة الحاسوية لمنع انقطاعات مستقبلية.
كتبه فلاديمير فيدوروف، الرئيس التقني لـGitHub، ويؤكد في المقالة التزام الشركة بالموثوقية من خلال التحسينات المعمارية والتغييرات التشغيلية.
المصدر: Hacker News · لخّصه HeadlinesBriefing