Вызов
Когда пользователь сталкивается с ошибкой или медленной загрузкой — это уже потерянный опыт. Долгое время не было системной картины того, насколько хорошо работает платформа прямо сейчас.
Проблемы замечались постфактум: через жалобы пользователей или рост числа обращений в поддержку. Принимать бизнес-решения об инвестициях в инфраструктуру приходилось без надёжных данных.
Что было сделано
Формальные обязательства по уровню сервиса, бюджет ошибок, масштабируемое хранение метрик и интеллектуальная маршрутизация алертов.
SLO/SLI — цели и измерение
Для более чем двадцати ключевых направлений платформы установлены SLO (Service Level Objectives) — формальные обязательства по уровню доступности и производительности. Для каждого рассчитываются SLI — метрики, которые показывают, насколько хорошо цель выполняется прямо сейчас.
Error Budget: контроль «бюджета ошибок»
Внедрена концепция бюджета ошибок: чётко определено, сколько деградации допустимо за период, и это значение непрерывно расходуется или восстанавливается. Команды видят, когда «запас надёжности» исчерпывается.
Grafana: дашборды для команд и для бизнеса
Созданы дашборды двух уровней: технические — для инженеров, бизнес-ориентированные — для менеджеров и руководства. Отдельно выведен мониторинг релизов: каждое обновление видно в реальном времени.
VictoriaMetrics: масштабируемое хранение
Проведена миграция на VictoriaMetrics — система хранения временных рядов, которая при той же стоимости даёт значительно большую производительность. Выделен отдельный кластер мониторинга.
Интеллектуальная маршрутизация алертов
Устранена проблема дублирования уведомлений: каждый инцидент теперь создаёт ровно одно оповещение, направляемое нужной команде по нужному каналу. Инженеры перестали игнорировать алерты из-за их избытка.
Мониторинг Service Mesh
Внедрено наблюдение за трафиком между сервисами через Istio: задержки, ошибки и зависимости между сервисами видны на дашбордах без дополнительного кода в приложениях.
Было / Стало
Бизнес видит реальную картину надёжности, а не ощущения. Команды видят, когда запас надёжности исчерпывается, и могут принять меры до инцидента.