Files
voidea/template/docs/checklists/04-incident-response.md
T

29 lines
1.4 KiB
Markdown

# Incident Response чеклист
## Immediate (первые 5 минут)
1. [ ] Определить severity
- **Critical**: сервис недоступен, данные потеряны
- **Major**: функциональность severely impacted
- **Minor**: не влияет на пользователей
2. [ ] Остановить кровотечение
- Rollback до последней стабильной версии
- Отключить проблемную функциональность
- Переключить на fallback
3. [ ] Уведомить команду
## Investigation (15-30 минут)
4. [ ] Проверить логи (app, nginx, system)
5. [ ] Проверить метрики (когда началось, что изменилось)
6. [ ] Проверить последний деплой / изменения
7. [ ] Воспроизвести проблему (если возможно)
## Resolution
8. [ ] Применить исправление
9. [ ] Проверить что сервис восстановлен
10. [ ] Уведомить о восстановлении
## Postmortem (в течение 24 часов)
11. [ ] Написать postmortem
12. [ ] Создать задачу на предотвращение
13. [ ] Добавить мониторинг / тест на этот сценарий