Files
voidea/template/docs/checklists/04-incident-response.md
T

1.4 KiB

Incident Response чеклист

Immediate (первые 5 минут)

  1. Определить severity
    • Critical: сервис недоступен, данные потеряны
    • Major: функциональность severely impacted
    • Minor: не влияет на пользователей
  2. Остановить кровотечение
    • Rollback до последней стабильной версии
    • Отключить проблемную функциональность
    • Переключить на fallback
  3. Уведомить команду

Investigation (15-30 минут)

  1. Проверить логи (app, nginx, system)
  2. Проверить метрики (когда началось, что изменилось)
  3. Проверить последний деплой / изменения
  4. Воспроизвести проблему (если возможно)

Resolution

  1. Применить исправление
  2. Проверить что сервис восстановлен
  3. Уведомить о восстановлении

Postmortem (в течение 24 часов)

  1. Написать postmortem
  2. Создать задачу на предотвращение
  3. Добавить мониторинг / тест на этот сценарий