1.4 KiB
1.4 KiB
Incident Response чеклист
Immediate (первые 5 минут)
- Определить severity
- Critical: сервис недоступен, данные потеряны
- Major: функциональность severely impacted
- Minor: не влияет на пользователей
- Остановить кровотечение
- Rollback до последней стабильной версии
- Отключить проблемную функциональность
- Переключить на fallback
- Уведомить команду
Investigation (15-30 минут)
- Проверить логи (app, nginx, system)
- Проверить метрики (когда началось, что изменилось)
- Проверить последний деплой / изменения
- Воспроизвести проблему (если возможно)
Resolution
- Применить исправление
- Проверить что сервис восстановлен
- Уведомить о восстановлении
Postmortem (в течение 24 часов)
- Написать postmortem
- Создать задачу на предотвращение
- Добавить мониторинг / тест на этот сценарий