← Все кейсы
FoodTech / Platform FoodTech-платформа

Инфраструктура, которая не тратит лишнего

FinOps

Вызов

Быстрый рост платформы — это не только новые функции, но и быстро растущий счёт за инфраструктуру. Ресурсы выделялись командами разработки «с большим запасом», без понимания реального потребления.

Не было ни инструментов для анализа, ни регламентов, ни ответственных. В результате — платформа потребляла значительно больше, чем требовалось фактически.

01 Нет прозрачности: кто, сколько и зачем потребляет ресурсы
02 Ресурсы выделяются без лимитов — перерасход не контролируется
03 Нет регулярного аудита: неэффективность накапливается незаметно

Что было сделано

Системный подход к управлению ресурсами: контракты, инспекции, оптимизация типов узлов и проактивное управление хранилищами.

Ресурсные контракты

Разработан и внедрён регламент потребления вычислительных ресурсов для каждого сервиса на платформе. Контракт фиксирует запрошенные и максимально допустимые ресурсы — память, CPU, дисковое пространство.

Плановые инспекции

Введён процесс регулярного аудита ресурсных контрактов: команды проверяют фактическое потребление, сравнивают с заявленным и корректируют лимиты. Это предотвращает накопление «мёртвого» резерва.

Оптимизация типов узлов

Проведён анализ и перераспределение продуктовых сервисов по разным типам вычислительных узлов в Kubernetes в соответствии с их профилем нагрузки. Ресурсоёмкие задачи — на мощные узлы, лёгкие сервисы — на дешёвые.

Мониторинг потребления

Для всех сервисов настроены дашборды с метриками фактического потребления ресурсов. Видно, где ресурсы избыточны, а где приближаются к лимиту.

Управление дисковым пространством

Выстроен процесс планового расширения дисковых ресурсов для баз данных и сервисов хранения. Аварийные ситуации из-за заполненных дисков устранены переходом к проактивному управлению.

KubernetesPrometheusGrafanaTerraformYandex CloudVictoriaMetrics

Было / Стало

Before Ресурсы без лимитов — команды берут сколько хотят
After Ресурсные контракты с явными лимитами для каждого сервиса
Before Нет видимости фактического потребления
After Дашборды с актуальными данными по каждому сервису
Before Нет процесса проверки — неэффективность копится
After Регулярные инспекции и корректировка лимитов
Before Однородные дорогие узлы для всех задач
After Оптимальный подбор типов узлов под профиль нагрузки
Before Аварийные отказы из-за переполненных дисков
After Плановое расширение хранилищ до достижения критических значений
Продуктовые команды получили понятный инструмент для обоснования своих ресурсных потребностей, а инфраструктурная команда — механизм контроля.
Инженерная команда FoodTech-платформа

Лежит прод, теряются заказы?

Подключимся в течение часа. Договор — потом.

Связаться сейчас