SRE инженер / MLOPS (удаленная работа)

27 июля 2026

Уровень зарплаты:
от 200 000 до 442 200 руб.
Требуемый опыт работы:
Не указан

Вакансия: SRE инженер / MLOPS

Описание вакансии

ТехВилл IT-компания и партне р ВкусВилл по развитию цифровых решении .

Мы отвечаем за разработку мобильных и web- приложении , автоматизацию бизнес-процессов, искусственныи интеллект, devops, инфобез ВкусВилла.

Нашими решениями пользуется свыше 1 000 000 клиентов и сотрудников ВкусВилла.

Мы строим кластер, где GPU - основной ресурс, и SRE должен уметь его эксплуатировать так же хорошо, как и агентскую часть.

Обязанности:

- практический опыт эксплуатации LLM-агентов: фреймворки, оркестрация многошаговых пайплайнов (LangGraph, LangChain или аналоги), жизненный цикл агентного запроса: planning tool calling validation

- опыт с Model Context Protocol: MCP-серверы и шлюзы, регистрация/проксирование инструментов, маршрутизация tool-calling между сервисами

- понимание tool/function calling, оркестрации инструментов (tool bus), RBAC на инструменты

- управление промптами: версионирование, A/B, выкатка без релиза сервиса

- RAG / семантический поиск как часть агентного пайплайна (recall rerank генерация)

- оценка качества агентов: eval-пайплайны, LLM-as-judge, Ragas на уровне эксплуатации

- надёжность агентных систем: недетерминизм ответов, тяжёлый хвост latency, стоимость токенов, guardrails, graceful degradatio

- трассировка LLM/агентных вызовов (Langfuse или аналоги: LangSmith): развёртывание, отдельная БД, сэмплирование трейсов, сквозной trace-id между сервисами

- распределённая трассировка на базе OpenTelemetry (OTLP), корреляция логов и трейсов

- метрики и алерты по токенам и стоимости инференса (Prometheus), контроль бюджетов и лимитов

- асинхронные Python 3.13 сервисы (FastAPI/Uvicorn/Gunicorn): multiprocess-метрики Prometheus, graceful shutdown, liveness/readiness/deep-health

- пакетный менеджер uv, сборка с приватными зависимостями (внутренний GitLab, Nexus PyPI proxy)

- паттерны устойчивости: circuit breaker (pybreaker), retry (tenacity), rate limiting, семафоры на конкуррентность

- Kafka + Avro + Schema Registry, потребление CDC-топиков (синхронизация каталога/PIM), паттерны DLQ

- очереди задач на Celery + Flower с брокером Redis

- Redis в режимах Cluster и Sentinel (кэш, rate-limit, чекпойнты), не только standalone

Требования:

- понимание/опыт развёртывания и эксплуатации LLM моделей на GPU (Triton Inference Server, vLLM, TensorRT LLM или аналоги)

- знание GPU мониторинга: DCGM, Prometheus, метрики по использованию памяти, ядер, температуры, NVLink

- опыт профилирования инференса: оптимизация latency (TTFT, TPS), throughput, работа с KV cache.

- управление ресурсами GPU в K8s: HAMi, MIG, time slicing, квотирование

понимание работы с NVDEC/NVENC.

Условия:

  • Работу в аккредитованной IT-компании.
  • Удалённая работа: для нас важны результаты работы без привязки к месту;
  • Официальное оформление с первого дня работы и поддержка куратора во время адаптации.
  • Прозрачная система развития: понятные грейды, внутреннее и внешнее обучение, индивидуальные планы развития и матрицы компетенций.
  • Экологичная культура и адекватные руководители.
  • Компенсация затрат на медицинские услуги, ментальное благополучие, спорт, тимбилдинги и использование AI-помощников.
  • Бонус 15% с покупок во ВкусВилл.
  • Социальная ответственность: поощряем донорство, оказываем материальную помощь при рождении ребёнка.
  • Партнерская программа Зелёный свет : за рекомендации знакомых специалистов можно получить до 50 000 руб.


Посмотрите похожие вакансии

Инженер LLM / SRE (LLM-платформа)
Компания: МАТРИ
Зарплата: з.п. не указана
Devops-инженер (Искусственный интеллект)
Компания: РСХБ-Интех
Зарплата: з.п. не указана