# Incident Response чеклист ## Immediate (первые 5 минут) 1. [ ] Определить severity - **Critical**: сервис недоступен, данные потеряны - **Major**: функциональность severely impacted - **Minor**: не влияет на пользователей 2. [ ] Остановить кровотечение - Rollback до последней стабильной версии - Отключить проблемную функциональность - Переключить на fallback (AI fallback, прямой вызов Celery) 3. [ ] Уведомить команду ## Investigation (15-30 минут) 4. [ ] Проверить логи (docker logs, journalctl) 5. [ ] Проверить метрики (когда началось, что изменилось) 6. [ ] Проверить последний деплой / изменения 7. [ ] Воспроизвести проблему (если возможно) ## Resolution 8. [ ] Применить исправление 9. [ ] Проверить что сервис восстановлен 10. [ ] Уведомить о восстановлении ## Postmortem (в течение 24 часов) 11. [ ] Написать postmortem 12. [ ] Создать задачу на предотвращение 13. [ ] Добавить мониторинг / тест на этот сценарий