DevOps-инженер (удаленная работа)
2 октября 2026
з.п. не указана
Не указан
Вакансия: DevOps-инженер
Описание вакансии
О проекте: Ищем DevOps-инженера , который возьмет на себя полную ответственность за надежность, доступность и отказоустойчивость сервисов в production-среде в соответствии со стандартами SLA/SLO. В ключевые задачи войдут развитие современной системы observability (метрики, логи, трейсы), участие в оперативных дежурствах, а также глубокое расследование инцидентов с поиском их первопричин и фиксацией опыта в постмортемах для защиты от повторных аварий.
Стек: CI/CD и автоматизация: Jenkins, GitLab CI, Ansible
Контроль версий и качество кода: Git, SonarQube, Nexus
Сборка: Maven, Gradle, NPM
Контейнеризация и оркестрация: Docker, Kubernetes/OpenShift, Docker Swarm
Service mesh: Istio
Данные и интеграции: PostgreSQL, Kafka, Redis
BPM/workflow: Camunda
ОС: Linux (Ubuntu/Debian)
Наблюдаемость: Prometheus, Grafana, Grafana Tempo, OpenTelemetry, Zabbix
Чем предстоит заниматься:
-
Поддерживать стабильность и доступность сервисов в production
-
Следить за состоянием сервисов в режиме реального времени, реагировать на инциденты и минимизировать время недоступности
-
Обеспечивать соответствие SLA/SLO, участвовать в дежурствах (on-call)
-
Расследовать инциденты, находить root cause и устранять аварии
-
Быстро локализовать проблему, устранить её и зафиксировать в постмортеме, чтобы она не повторилась (анализировать цепочку событий, а не только симптомы)
-
Проектировать и развивать наблюдаемость (observability)
-
Развивать систему метрик, логов, трейсов, алертинга и дашбордов на базе Prometheus, Grafana, Grafana Tempo, OpenTelemetry и т.д
-
Улучшать существующие алерты, убирать шум, закрывать слепые пятна в мониторинге
-
Помогать командам разработки и эксплуатации
-
Выступать точкой экспертизы при расследовании нештатных ситуаций: помогать читать логи, интерпретировать метрики, находить узкие места
-
Работать на стыке команд, чтобы проблемы решались быстрее и системнее
Что мы ждем:
- Linux (Ubuntu/Debian) на уровне администратора
- Понимание сетей: TCP/IP, маршрутизация, DNS, NAT, SSL/CORS
- Опыт работы с веб-серверами и балансировщиками: Nginx, HAProxy
- Ansible: роли, шаблоны, inventory, идемпотентность
- Docker / Docker Compose в production
- Понимание сборки образов и оркестрации (Swarm/Kubernetes)
- Уверенный Bash (чтение чужого и написание своего)
