Вызов
Компания развивала машинное обучение внутри команд, но разработка упиралась в инфраструктуру: эксперименты шли в разрозненных локальных средах, а доступа к мощным вычислениям по требованию не было. Чтобы масштабировать ML внутри компании, нужно было создать единую среду разработки с масштабируемыми GPU.
Архитектура и ключевые решения
Мы построили корпоративную среду ML-разработки: единый доступ к ноутбукам и масштабируемым GPU-вычислениям для разных категорий пользователей.
JupyterHub Platform
Развернули корпоративный JupyterHub с интеграцией через Keycloak SSO — единый вход для всех пользователей платформы.
Self-service окружения
Реализовали кастомный механизм выбора окружений и вычислительных ресурсов для различных категорий пользователей.
GPU Computing
Организовали работу с Nvidia Tesla T4 через Kubernetes с динамическим масштабированием вычислительных узлов. Это позволило эффективно использовать дорогостоящие GPU-ресурсы и оплачивать только фактическую нагрузку.
Было / Стало
Команда получила возможность быстрее разрабатывать и внедрять ML-модели — с доступом к масштабируемым GPU по требованию и единой средой для экспериментов.