Мониторинг зелёный. /health отвечает 200 OK. CPU и память в пределах нормы. — 3 июля 2026 г. в 11:15:00.954
Мониторинг зелёный. /health отвечает 200 OK. CPU и память в пределах нормы. А пользователи уже пишут: «Войти в систему почти невозможно». На первый взгляд противоречие. На практике — разница между доступностью endpoint и работоспособностью пользовательского сценария. Условный артефакт: GET /health HTTP 200 OK response_time: 80 ms body: {"status":"ok"} POST /login response_time: 8.7 s result: success Формально сервис жив. Но авторизация работает медленно. На этом участке могут быть зависимости: база, LDAP, SSO, внешний API, очередь или другой внутренний сервис. Почему зелёный статус не спасает? Потому что в конкретной реализации /health может проверять только быстрый технический ответ приложения. Он не всегда проверяет: — зависимость, которая нужна именно для входа; — время ответа пользовательского сценария; — корректность содержимого ответа; — работу следующего шага после авторизации; — деградацию, которая ещё не стала полной недоступностью. Это не значит, что /health бесполезен. Он нужен как быстрый технический индикатор. Ошибка начинается там, где один 200 OK принимают за доказательство нормальной работы всего сервиса. В Zabbix такой подход настраивают через web-сценарии: несколько HTTP-шагов, ожидаемый статус, ожидаемое содержимое, время ответа и отдельные триггеры на деградацию. Для сценариев авторизации нужна безопасная тестовая учётная запись с минимально необходимыми правами. Пароли, токены и cookies нельзя выводить в логи, скриншоты или публичные артефакты. Практический вывод: зелёный /health полезен, но он не должен быть единственным индикатором состояния критичного сервиса. Для важных систем стоит отдельно мониторить ключевые сценарии: вход, поиск, оформление заявки, создание заказа, получение отчёта. Web-сценарии не заменяют инфраструктурные метрики, логи, трассировку и APM, но помогают раньше увидеть деградацию того, что важно пользователю. На курсах по Zabbix в УЦ ФОРС такие задачи разбираются на практике: web-сценарии, проверки содержимого, response time, триггеры деградации и связь мониторинга с эксплуатацией.

