← Все кейсы
ML / Инфраструктура ML-платформа

Вычисления для ML по требованию

Корпоративная среда ML-разработки с масштабируемыми GPU

Вызов

Компания развивала машинное обучение внутри команд, но разработка упиралась в инфраструктуру: эксперименты шли в разрозненных локальных средах, а доступа к мощным вычислениям по требованию не было. Чтобы масштабировать ML внутри компании, нужно было создать единую среду разработки с масштабируемыми GPU.

01 Масштабирование ML-разработки внутри компании
02 Доступ к GPU-ресурсам по требованию
03 Эксперименты в разрозненных локальных средах

Архитектура и ключевые решения

Мы построили корпоративную среду ML-разработки: единый доступ к ноутбукам и масштабируемым GPU-вычислениям для разных категорий пользователей.

JupyterHub Platform

Развернули корпоративный JupyterHub с интеграцией через Keycloak SSO — единый вход для всех пользователей платформы.

Self-service окружения

Реализовали кастомный механизм выбора окружений и вычислительных ресурсов для различных категорий пользователей.

GPU Computing

Организовали работу с Nvidia Tesla T4 через Kubernetes с динамическим масштабированием вычислительных узлов. Это позволило эффективно использовать дорогостоящие GPU-ресурсы и оплачивать только фактическую нагрузку.

JupyterHubKubernetesNVIDIA Tesla T4KeycloakGPU Autoscaling

Было / Стало

Before Эксперименты в локальных средах
After Корпоративная ML-платформа
Before Ограниченные вычислительные ресурсы
After Масштабируемая GPU-инфраструктура
Before Дорогие GPU простаивают или недоступны
After Оплата только фактической нагрузки
Команда получила возможность быстрее разрабатывать и внедрять ML-модели — с доступом к масштабируемым GPU по требованию и единой средой для экспериментов.
Инженерная команда ML-платформа

Лежит прод, теряются заказы?

Подключимся в течение часа. Договор — потом.

Связаться сейчас