← Все кейсы
FoodTech / Platform FoodTech-платформа

Найти причину за минуты, а не за часы

Distributed Tracing и отказоустойчивая наблюдаемость

Вызов

В декабре 2025 года серия инцидентов обнажила системную проблему: когда что-то ломалось, команда тратила часы на поиск причины. Метрики хранились недолго, логи были недоступны при недоступности одной из зон, распределённые запросы нельзя было отследить сквозь цепочку сервисов.

Диагностика была похожа на расследование без улик. После инцидентов была запущена программа глубокой модернизации системы наблюдаемости.

01 При серьёзном сбое логи и метрики становились недоступны именно тогда, когда они нужнее всего
02 Нет распределённой трассировки: невозможно проследить запрос пользователя через цепочку из десятков сервисов
03 Метрики хранились три месяца — недостаточно для анализа трендов и выполнения SLA

Что было сделано

Полная реархитектура системы наблюдаемости: зональная отказоустойчивость, сквозная трассировка, единый стандарт логирования и год хранения метрик.

Отказоустойчивая система метрик

Проведена реархитектура — компоненты сбора и хранения метрик теперь работают независимо по зонам, недоступность одной зоны не прерывает мониторинг всей платформы.

Распределённая трассировка

Внедрён Distributed Tracing — механизм, который прикрепляет уникальный идентификатор к каждому запросу пользователя и фиксирует его путь через все сервисы платформы. Время диагностики сократилось с часов до минут.

Единая стратегия логирования

Выработан и задокументирован подход к сбору журналов для всей платформы в Yandex Cloud. Раньше каждая команда решала этот вопрос по-своему. Теперь есть единый стандарт: формат, уровни, маршрутизация, хранение.

Отказоустойчивость журналирования

При инциденте Kibana и Elasticsearch были недоступны более 24 часов. Проведена реархитектура с зональной изоляцией — система сбора журналов теперь переживает отказ одной зоны без потери видимости.

Год хранения метрик

Ранее SLI-метрики хранились три месяца. Реализовано увеличение срока хранения до одного года. Это закрывает требования по SLA-отчётности и позволяет анализировать сезонные паттерны нагрузки.

Оптимизация стоимости хранения

Разработана стратегия хранения журналов: горячие данные для оперативной диагностики, холодный архив для compliance. Это снижает стоимость без потери доступности нужных данных.

VictoriaMetricsGrafanaElasticsearchKibanaJaegerPrometheusKubernetesYandex Cloud

Было / Стало

Before При инциденте метрики недоступны — диагностика вслепую
After Зонально-устойчивая система: метрики доступны даже при сбое зоны
Before Нет трассировки: причина медленного запроса неизвестна
After Distributed Tracing: путь запроса виден через все сервисы
Before Логи недоступны при инциденте в зоне — 24+ часа слепоты
After Изолированная по зонам система логирования
Before Метрики хранятся 3 месяца — нет истории для SLA-отчётов
After Год хранения SLI-метрик, соответствие требованиям по SLA
Before Каждая команда логирует по-своему — хаос при диагностике
After Единый стандарт логирования для всей платформы
Диагностика была похожа на расследование без улик. Теперь инженер видит полный граф запроса: на каком сервисе, на каком шаге и сколько времени потеряно.
Инженерная команда FoodTech-платформа

Лежит прод, теряются заказы?

Подключимся в течение часа. Договор — потом.

Связаться сейчас