Найти причину за минуты, а не за часы
Distributed Tracing и отказоустойчивая наблюдаемость
Вызов
В декабре 2025 года серия инцидентов обнажила системную проблему: когда что-то ломалось, команда тратила часы на поиск причины. Метрики хранились недолго, логи были недоступны при недоступности одной из зон, распределённые запросы нельзя было отследить сквозь цепочку сервисов.
Диагностика была похожа на расследование без улик. После инцидентов была запущена программа глубокой модернизации системы наблюдаемости.
Что было сделано
Полная реархитектура системы наблюдаемости: зональная отказоустойчивость, сквозная трассировка, единый стандарт логирования и год хранения метрик.
Отказоустойчивая система метрик
Проведена реархитектура — компоненты сбора и хранения метрик теперь работают независимо по зонам, недоступность одной зоны не прерывает мониторинг всей платформы.
Распределённая трассировка
Внедрён Distributed Tracing — механизм, который прикрепляет уникальный идентификатор к каждому запросу пользователя и фиксирует его путь через все сервисы платформы. Время диагностики сократилось с часов до минут.
Единая стратегия логирования
Выработан и задокументирован подход к сбору журналов для всей платформы в Yandex Cloud. Раньше каждая команда решала этот вопрос по-своему. Теперь есть единый стандарт: формат, уровни, маршрутизация, хранение.
Отказоустойчивость журналирования
При инциденте Kibana и Elasticsearch были недоступны более 24 часов. Проведена реархитектура с зональной изоляцией — система сбора журналов теперь переживает отказ одной зоны без потери видимости.
Год хранения метрик
Ранее SLI-метрики хранились три месяца. Реализовано увеличение срока хранения до одного года. Это закрывает требования по SLA-отчётности и позволяет анализировать сезонные паттерны нагрузки.
Оптимизация стоимости хранения
Разработана стратегия хранения журналов: горячие данные для оперативной диагностики, холодный архив для compliance. Это снижает стоимость без потери доступности нужных данных.
Было / Стало
Диагностика была похожа на расследование без улик. Теперь инженер видит полный граф запроса: на каком сервисе, на каком шаге и сколько времени потеряно.