MLOps Engineer (Devops) (удаленная работа)

24 сентября 2026

Уровень зарплаты:
з.п. не указана
Требуемый опыт работы:
Не указан

Вакансия: MLOps Engineer (Devops)

Описание вакансии

Направление работы:

ML Platform платформенная команда в отделе Trust & Safety Wildberries. Мы отвечаем за ML-инфраструктуру модерации контента и карточек товаров. Ежедневно через наши системы проходят десятки миллионов карточек это сотни миллионов предсказаний по 100+ ML-моделям. Модели крутятся в Nvidia Triton Inference Server на GPU-кластере в нескольких дата-центрах; пиковая нагрузка на инференс порядка 400 500K RPS, десятки инстансов Triton.

Исторически платформа выросла из модерации, сейчас становится самостоятельным юнитом и расширяется на все направления T&S. В отделе работают 50+ DS, и единой платформы для них пока нет. Мы это меняем строим общую мультитенантную ML-платформу для всего отдела.

Ищем ML Infrastructure Engineer (MLOps) на инфраструктурный слой платформы: GPU-кластер, разделение ресурсов между командами, ML-тулинг, среда обучения, стандартизация пайплайнов.

Стань частью команды!

Вам предстоит:

  • Отвечать за GPU-кластер целиком: драйверы, GPU Operator, DCGM-мониторинг, утилизация, планирование ёмкости;

  • Выстроить стратегию разделения GPU между командами в гетерогенной среде, квоты и приоритеты;

  • Поднять единый Kubeflow и ClearML как стандарт для DS-команд отдела;

  • Оптимизировать inference-инфраструктуру - автоскейлинг GPU-нод, bin-packing, утилизация;

  • Строить инфраструктуру Embedding Store (pgvector, FAISS, qdrant);

  • Общаться с DS-командами, понимать их потребности и переводить в инфраструктурные решения;

  • Раскатать платформу на остальные команды Trust & Safety с полноценной мультитенантностью.

Формат работы - гибридный или удаленный по договоренности с руководителем.

Вы нам подходите, если:

  • Имеете глубокое понимание Kubernetes: операторы, scheduling, resource management, GPU в K8s (device plugin, GPU Operator);

  • Имеете практический опыт с NVIDIA GPU: драйверы и CUDA-стек, DCGM, MIG или time-slicing;

  • Имеете опыт развёртывания и поддержки MLOps-платформ для DS-команд (ClearML, MLflow, Kubeflow, Airflow или аналоги);

  • Владеете Linux и bare-metal, IaC (Ansible или Terraform), Helm;

  • Имеете опыт разработки на Python или Go: операторы, экспортеры, внутренний тулинг;

  • Умеете взаимодействовать с DS-командами и переводить потребности в технические решения;

Будет плюсом:

  • Опыт с Triton Inference Server, vLLM, KServe или аналогами;

  • Опыт разделения и виртуализации GPU в Kubernetes для multi-tenant окружений;

  • Понимание векторных БД и их оптимизации (pgvector, FAISS, Milvus);

  • Сторадж под данные обучения: S3, Ceph, NFS;

  • Multi-node training: NCCL, InfiniBand, RDMA.



Посмотрите похожие вакансии

Старший DevOps - инженер / MLOps Platform
Компания: USETECH
Зарплата: з.п. не указана
Senior MLOps & BlockchainOps Engineer (DevOps Engineer in AI & Blockchain products)
Компания: Simplenight
Зарплата: от 300 000 до 600 000 руб.
Senior DevOps Engeneer / TechLead
Компания: Hilbert Team
Зарплата: з.п. не указана