29 lines
1.4 KiB
Markdown
29 lines
1.4 KiB
Markdown
# Incident Response чеклист
|
|
|
|
## Immediate (первые 5 минут)
|
|
1. [ ] Определить severity
|
|
- **Critical**: сервис недоступен, данные потеряны
|
|
- **Major**: функциональность severely impacted
|
|
- **Minor**: не влияет на пользователей
|
|
2. [ ] Остановить кровотечение
|
|
- Rollback до последней стабильной версии
|
|
- Отключить проблемную функциональность
|
|
- Переключить на fallback
|
|
3. [ ] Уведомить команду
|
|
|
|
## Investigation (15-30 минут)
|
|
4. [ ] Проверить логи (app, nginx, system)
|
|
5. [ ] Проверить метрики (когда началось, что изменилось)
|
|
6. [ ] Проверить последний деплой / изменения
|
|
7. [ ] Воспроизвести проблему (если возможно)
|
|
|
|
## Resolution
|
|
8. [ ] Применить исправление
|
|
9. [ ] Проверить что сервис восстановлен
|
|
10. [ ] Уведомить о восстановлении
|
|
|
|
## Postmortem (в течение 24 часов)
|
|
11. [ ] Написать postmortem
|
|
12. [ ] Создать задачу на предотвращение
|
|
13. [ ] Добавить мониторинг / тест на этот сценарий
|