DevOps-engineer в GenAI (удаленная работа)

5 сентября 2026

Уровень зарплаты:
от 244 400 до 302 200 руб.
Требуемый опыт работы:
Не указан

Вакансия: DevOps-engineer в GenAI

Описание вакансии

Добрый день!

Добрый день!

Компания Sasha AI текущие резиденты Сколково, пионер в разработке голосовых AI-агентов для бизнеса. Мы развиваем лидогенерационную платформу, которая позволяет компаниям за 20 минут запустить искусственный интеллект, способный генерировать лидов, работая с клиентской базой по телефону. Наши AI-агенты уже помогают крупным компаниям увеличивать выручку без найма сотрудников.

За последний год мы выросли в 5 раз и достигнем оборота в 300 млн рублей в 2026 году.

Наша маленькая цель сделать технологию простой, окупаемой и доступной каждому крупному бизнесу в России.

Наша большая цель за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России.

Чем предстоит заниматься

  • Быстро войти в курс дела, подхватить существующую инфраструктуру и сервисы без сбоев и навести в них порядок.
  • Поддерживать и развивать инфраструктуру высоконагруженной микросервисной платформы: реальная аудитория, реальные RPS, живой голосовой трафик в реальном времени.
  • Перевести инфраструктуру на IaC (Terraform / OpenTofu / Ansible) как облачную, так и собственную.
  • Упаковывать сервисы в Docker, разворачивать и сопровождать их в Kubernetes: Helm-чарты, оптимизация манифестов, сетевые политики, при необходимости Service Mesh.
  • Строить и развивать CI/CD: быстрые, предсказуемые и безопасные релизы с ориентиром на метрики DORA; встраивать проверки безопасности (SAST/DAST, сканирование образов) и централизованное управление секретами.
  • Выстроить сквозную наблюдаемость: мониторинг и алертинг на Prometheus/Grafana, централизованное логирование, распределённую трассировку чтобы о проблемах мы узнавали раньше клиентов.
  • Внедрить практики SRE: определить SLI/SLO/SLA для ключевых сервисов, управлять бюджетами ошибок.
  • Управлять инцидентами: оперативно локализовать аварии, снижать MTTR, проводить blameless post-mortems и доводить их выводы до внедрения.
  • Обеспечивать отказоустойчивость систем, от которых напрямую зависит выручка клиентов: бэкапы, резервирование, репликация БД, план восстановления.
  • Работать с облачными провайдерами и собственной инфраструктурой, оптимизировать стоимость и надёжность (FinOps).
  • Выявлять повторяющиеся ручные операции и автоматизировать их, удерживая долю toil в разумных пределах.
  • Самостоятельно исследовать платные и OSS-решения, собирать обратную связь от команды и внедрять лучшее во внутренний контур компании.

Наш стек

  • Бэкенд: Node.js, TypeScript, NestJS, PostgreSQL, Redis, ClickHouse, Yandex VBD.
  • Фронтенд: TypeScript, Next.js, Tailwind CSS.
  • Инфраструктура: Kubernetes, Docker, PM2, Prometheus/Grafana, облачные провайдеры (Cloudflare, DigitalOcean и другие).
  • Телефония: Asterisk, ARI/AMI.

Мы ищем того, кто

  • Имеет опыт поддержки нагруженных сервисов с реальной аудиторией и реальными RPS не в лаборатории, а в продакшене.
  • Разворачивал собственную инфраструктуру с нуля и понимает, как она устроена под капотом .
  • Хорошо знает Linux и сети: модель OSI, TCP/IP, DNS, балансировка нагрузки (NGINX, HAProxy, ALB/NLB), устройство сетей в Kubernetes.
  • Имеет практический опыт упаковки приложений в Docker и глубоко знает Kubernetes включая Helm, оптимизацию манифестов и сетевые политики.
  • Владеет IaC-инструментами (Terraform, OpenTofu или Ansible) для полного управления инфраструктурой.
  • Настраивал CI/CD-пайплайны и сквозной мониторинг через Prometheus/Grafana, логирование и трассировку.
  • Проектировал отказоустойчивые системы, определял SLI/SLO/SLA и работал с error budgets.
  • Умеет управлять инцидентами: локализация, MTTR, blameless post-mortems.
  • Свободно пишет на Go, Python или Bash для автоматизации инфраструктурных задач.
  • Понимает масштабирование, репликацию и резервное копирование SQL/NoSQL (PostgreSQL, Redis, ClickHouse).
  • Работал с облачными провайдерами и умеет оптимизировать затраты на инфраструктуру.
  • Умеет работать автономно: взять цель, изучить варианты, выбрать решение, внедрить и довести до результата.
  • Искренне интересуется инфраструктурой и хочет расти в этом направлении.

Будет большим плюсом

  • Опыт с Cloudflare, DigitalOcean и аналогичными зарубежными сервисами.
  • Опыт или понимание принципов работы телефонии (Asterisk, SIP/RTP).
  • Опыт с Service Mesh и написания Kubernetes-операторов.
  • DevSecOps-практика: интеграция SAST/DAST и сканирования образов в CI/CD, управление секретами.
  • Опыт миграции систем и проектирования микросервисной архитектуры.
  • MLOps-опыт: развёртывание и сопровождение ML-моделей в продакшене.
  • Интерес к миру AI/ML и желание погружаться в предметную область.

Что мы предлагаем

  • Реальная impact-роль: стабильность инфраструктуры напрямую влияет на оборот компании и продукт для лидеров рынка.
  • Сложные и масштабные задачи: высокие нагрузки, голосовой трафик в реальном времени, интеграции, уникальная экспертиза на стыке AI и телефонии.
  • Свобода в выборе решений: вы сами исследуете, предлагаете и внедряете инструменты мы доверяем экспертизе.
  • Современный стек и возможность освоить нишевую технологию (Asterisk + AI), которой владеют немногие.


Посмотрите похожие вакансии

Старший инженер GenAI / Разработчик
Компания: USETECH
Зарплата: з.п. не указана