← Все кейсы
FoodTech / Platform FoodTech-платформа

Знать о проблеме раньше пользователя

SLO и наблюдаемость

Вызов

Когда пользователь сталкивается с ошибкой или медленной загрузкой — это уже потерянный опыт. Долгое время не было системной картины того, насколько хорошо работает платформа прямо сейчас.

Проблемы замечались постфактум: через жалобы пользователей или рост числа обращений в поддержку. Принимать бизнес-решения об инвестициях в инфраструктуру приходилось без надёжных данных.

01 Нет единого понимания, насколько надёжно работает платформа в каждый момент времени
02 Инциденты обнаруживались реактивно — по жалобам, а не по метрикам
03 Нет измеримых целей по доступности для продуктовых команд и бизнеса

Что было сделано

Формальные обязательства по уровню сервиса, бюджет ошибок, масштабируемое хранение метрик и интеллектуальная маршрутизация алертов.

SLO/SLI — цели и измерение

Для более чем двадцати ключевых направлений платформы установлены SLO (Service Level Objectives) — формальные обязательства по уровню доступности и производительности. Для каждого рассчитываются SLI — метрики, которые показывают, насколько хорошо цель выполняется прямо сейчас.

Error Budget: контроль «бюджета ошибок»

Внедрена концепция бюджета ошибок: чётко определено, сколько деградации допустимо за период, и это значение непрерывно расходуется или восстанавливается. Команды видят, когда «запас надёжности» исчерпывается.

Grafana: дашборды для команд и для бизнеса

Созданы дашборды двух уровней: технические — для инженеров, бизнес-ориентированные — для менеджеров и руководства. Отдельно выведен мониторинг релизов: каждое обновление видно в реальном времени.

VictoriaMetrics: масштабируемое хранение

Проведена миграция на VictoriaMetrics — система хранения временных рядов, которая при той же стоимости даёт значительно большую производительность. Выделен отдельный кластер мониторинга.

Интеллектуальная маршрутизация алертов

Устранена проблема дублирования уведомлений: каждый инцидент теперь создаёт ровно одно оповещение, направляемое нужной команде по нужному каналу. Инженеры перестали игнорировать алерты из-за их избытка.

Мониторинг Service Mesh

Внедрено наблюдение за трафиком между сервисами через Istio: задержки, ошибки и зависимости между сервисами видны на дашбордах без дополнительного кода в приложениях.

PrometheusGrafanaVictoriaMetricsAlertmanagerIstioKubernetes

Было / Стало

Before Нет понимания, «сколько 9-ок» у платформы
After Чёткие SLO для более чем 20 ключевых направлений
Before Инциденты обнаруживаются по жалобам пользователей
After Автоматические алерты опережают жалобы
Before Разрозненные метрики, нет единой картины
After Единый центр наблюдаемости в Grafana
Before Потоки уведомлений — инженеры их игнорируют
After Одно релевантное уведомление на инцидент
Before Данные о нагрузке и доступности недоступны бизнесу
After Бизнес-дашборды с понятными метриками для руководства
Бизнес видит реальную картину надёжности, а не ощущения. Команды видят, когда запас надёжности исчерпывается, и могут принять меры до инцидента.
Инженерная команда FoodTech-платформа

Лежит прод, теряются заказы?

Подключимся в течение часа. Договор — потом.

Связаться сейчас