← Все кейсы
FoodTech / Аналитика Аналитическая платформа

От разрозненных логов до полной наблюдаемости

Централизованный мониторинг, трассировка и метрики приложений

Вызов

Платформа обрабатывает данные из десятков ресторанов в реальном времени: выручка, посещаемость, онлайн-заказы. При этом разобраться в причинах инцидента было крайне сложно: логи были разбросаны по отдельным контейнерам, внутренние вызовы между сервисами никак не фиксировались, а метрики состояния приложений не собирались вовсе. Каждый инцидент превращался в многочасовой детектив.

01 Журналы разбросаны по контейнерам — поиск причины занимал часы
02 Внутренние вызовы между сервисами — полный «чёрный ящик»
03 Метрики состояния приложений отсутствовали — деградация незаметна

Что было сделано

Полный стек наблюдаемости: централизованные журналы, сквозная трассировка и мониторинг приложений в изолированном контуре.

Централизованное журналирование

Развёрнута единая система сбора и хранения логов. Журналы всех сред агрегируются в одном месте: нужный фрагмент находится за секунды с помощью полнотекстового поиска, а аномалии видны сразу на дашборде.

Распределённая трассировка

Добавлена сквозная трассировка на уровне всего стека микросервисов. Каждый внешний запрос порождает дерево внутренних вызовов с временными метками на каждом шаге. Теперь видно, какой именно сервис добавляет задержку.

Мониторинг приложений и бизнес-метрик

Метрики состояния сервисов (память, сборщик мусора, пул соединений, HTTP-запросы, пользовательские показатели бизнес-логики) собираются автоматически и визуализируются в едином дашборде.

Изолированная среда наблюдаемости

Журналы, трассировки и метрики вынесены в отдельный изолированный контур, не зависящий от прикладных сред. Это позволяет одновременно наблюдать за разработкой, стейджингом и production.

ElasticsearchKibanaJaegerPrometheusGrafanaKubernetes

Было / Стало

Before Логи разбросаны по контейнерам, поиск — часы
After Централизованные журналы, любой лог — за секунды
Before Внутренние вызовы — «чёрный ящик»
After Сквозная трассировка по всему стеку
Before Метрики приложений — отсутствовали
After Полный мониторинг состояния сервисов в реальном времени
Before Траблшутинг — хаотичный, часы
After Управляемый процесс: от симптома до причины за минуты
Когда мы впервые увидели полный путь запроса от входа до базы данных — стало понятно, почему отдельные отчёты грузились медленно. Проблема, которую не могли найти месяцами, решилась за один день.
Инженерная команда Аналитическая платформа

Лежит прод, теряются заказы?

Подключимся в течение часа. Договор — потом.

Связаться сейчас