ثبّت الخدمة أولًا وفسّر لاحقًا
Production Incident مشكلة موثوقية تحت ضغط الوقت. الهدف الأول تقليل أثر العميل ومنع التدهور؛ يمكن أن يأتي اليقين بالسبب الجذري لاحقًا. الاستجابة القابلة للتكرار تفصل القيادة والتحقيق التقني والتواصل وحفظ الأدلة حتى لا يتحول التشخيص إلى نقاش جماعي فوضوي.
أدوار الحادث تقلل تكلفة التنسيق
- حدد Severity حسب أثر العميل/العمل لا قلق المهندسين.
- عين Incident Lead وقناة تواصل واحدة.
- فضل احتواء قابلًا للعكس: Rollback أو تعطيل Feature أو Shed Load أو Failover أو إيقاف Worker.
- سجل Timeline للحقائق والتغييرات والقرارات أثناء الحادث.
- بعد الاستعادة حدد ظروف النظام المساهمة وإجراءات دائمة بدل اللوم.
اكتشف واحتوِ واستعد وتعلم
يتحول الاكتشاف إلى استجابة معلنة، ويقلل الاحتواء الأثر، وتستعيد Recovery الخدمة، ويثبت Verification الاستقرار، ثم يحول Follow-up الأدلة إلى عمل وقائي.
دورة الاستجابة للحادث
يتحول الاكتشاف إلى استجابة معلنة، ويقلل الاحتواء الأثر، وتستعيد Recovery الخدمة، ويثبت Verification الاستقرار، ثم يحول Follow-up الأدلة إلى عمل وقائي.
نشر فاشل تحت حركة العملاء
عادات تزيد ضرر الحادث
قائمة الاستجابة التشغيلية
- حدد Owner وSeverity وImpact وقناة التواصل.
- جمّد التغييرات غير المرتبطة.
- اختر احتواء آمنًا وقابلًا للعكس.
- احتفظ Timeline مؤرخًا وأدلة.
- تحقق من التعافي عبر Business Signals ثم أنشئ Follow-up Actions بمالكين.
