Начальник отдела мониторинга и дежурной службы эксплуатации (удаленная работа)
21 августа 2026
з.п. не указана
Не указан
Вакансия: Начальник отдела мониторинга и дежурной службы эксплуатации
Описание вакансии
Крупная российская компания с развитым бизнесом и собственными IT-решениями. Мы создаём и развиваем цифровые продукты, автоматизируем бизнес-процессы и внедряем современные технологии.
Работаем над масштабными задачами, где IT напрямую влияет на развитие бизнеса.
Ищем руководителя, который выстроит и возглавит работу круглосуточной дежурной службы и системы мониторинга. Ваша ключевая цель обеспечить стабильную работу сервисов за счёт своевременного выявления инцидентов, чёткой организации дежурств, прозрачных процессов реагирования и регулярной отчётности. Вы будете отвечать не только за оперативное устранение сбоев, но и за развитие процессов, снижение количества и длительности инцидентов, а также за повышение зрелости службы мониторинга.
Задачи
- Организовать и руководить работой дежурной службы 24 7: графики дежурств, ротация, эскалации, передача смен, контроль исполнения регламентов
- Выстроить процессы мониторинга и реагирования на инциденты: SLA по времени обнаружения и устранения, матрицы эскалации, чек листы действий дежурных, сценарии автоуведомлений
- Настроить и поддерживать систему мониторинга: ключевые метрики (uptime, latency, ошибки, нагрузка), алерты, дашборды, корреляцию событий, исключение шума и ложных срабатываний
- Управлять жизненным циклом инцидентов: регистрация, приоритизация, координация команд, разбор причин (post mortem), фиксация выводов и мер по предотвращению повторов
- Формировать регулярную отчётность по работе службы: статистика инцидентов (количество, длительность, влияние), тренды по доступности сервисов, эффективность реагирования, динамика SLA, предложения по улучшению
- Оптимизировать процессы эксплуатации: автоматизировать типовые действия дежурных, внедрять runbooks и playbooks, снижать ручные операции, повышать наблюдаемость систем
- Обеспечивать взаимодействие со смежными подразделениями (разработка, DevOps, SRE, ИБ, поддержка): регламенты взаимодействия, совместные учения, разбор сложных инцидентов
- Участвовать в планировании и внедрении изменений, влияющих на доступность: релизы, миграции, масштабирование; согласовывать окна работ и контрольные точки мониторинга
- Развивать команду: обучение дежурных, наставничество, оценка компетенций, формирование базы знаний и инструкций
- Вести документацию отдела: регламенты, инструкции, матрицы ответственности, журналы изменений, отчёты и результаты аудитов процессов
Требования
- Опыт руководящей работы в эксплуатации, мониторинге или дежурной службе от 3 лет; опыт управления командой дежурных инженеров
- Практический опыт построения процессов 24 7, включая графики, эскалации, SLA/SLO, post mortem разборы
- Глубокое понимание принципов мониторинга и наблюдаемости: метрики, логи, трейсы, корреляция событий, снижение шума алертов
- Знание инструментов мониторинга и алертинга (Prometheus, Grafana, Zabbix, Nagios, ELK/Loki и аналоги), опыт настройки дашбордов и алертов под бизнес требования
- Понимание жизненного цикла инцидента, умение формализовать процессы и измерять эффективность службы (MTTR, MTBF, процент инцидентов в SLA)
- Опыт формирования отчётности и визуализации метрик для технических и бизнес аудиторий
- Базовое понимание инфраструктуры и сервисов: Linux, сети, контейнеризация, CI/CD, принципы отказоустойчивости и высокой доступности
- Навыки автоматизации и работы с инструментами (Bash, Python, скрипты для интеграции с системами уведомлений и тикетами)
- Умение выстраивать процессы и регламенты, договариваться со смежными командами, отстаивать приоритеты и обосновывать инвестиции в инструменты и процессы
- Готовность к участию в дежурствах и оперативному реагированию на критические инциденты при необходимости
Что предлагаем
- Конкурентную заработную плату уровень дохода обсуждаем индивидуально с учётом опыта и экспертизы
- ДМС заботимся о здоровье сотрудников и предоставляем расширенные программы
- Обучение и развитие доступ к курсам, профессиональным программам и внутреннему обучению
- Карьерный рост возможности развиваться в своей специализации и переходить на новые направления
- Интересные IT-задачи участие в проектах, которые напрямую влияют на развитие крупного бизнеса
- Современный стек и технологии возможность работать с актуальными инструментами и подходами
- Гибкий формат работы обсуждаем удобный формат взаимодействия в зависимости от позиции и задач
- Сильная команда работа с опытными специалистами из IT и смежных бизнес-направлений
- Стабильность крупная компания с масштабными проектами и долгосрочными планами развития
- Корпоративные бонусы скидки на продукцию компании и дополнительные программы для сотрудников
- Комфортные условия работы современная рабочая среда, необходимые инструменты и всё для эффективной работы
