Senior SRE (удаленная работа)

12 сентября 2026

Уровень зарплаты:
з.п. не указана
Требуемый опыт работы:
Не указан

Вакансия: Senior SRE

Описание вакансии

Мы создаём цифровой финансовый продукт, который меняет подход к кредитованию: карту без процентов и годового обслуживания, полностью управляемую через мобильное приложение. Продукт работает в трёх регионах, обслуживает около 300 000 пользователей и выдерживает нагрузку более 500 RPS.

Мы ищем Senior SRE, который возьмёт на себя ответственность за процессы Monitoring & Event Management и Availability & Capacity Management. В этой роли важно не просто реагировать на инциденты, а выстраивать системную надёжность: прогнозировать нагрузку, определять измеримые цели по доступности, развивать observability и превращать выводы из сбоев в устойчивые изменения.

Ключевые зоны ответственности

  • Availability & Capacity Management: доступность, производительность, прогнозирование нагрузки и достаточность ресурсов.
  • Monitoring & Event Management: качество мониторинга, событий, алертов и процессов реакции.
  • Observability: метрики, логи, трассировки, дашборды и диагностическая готовность систем.
  • Reliability governance: SLI/SLO, анализ инцидентов, disaster recovery и системные улучшения.

Чем предстоит заниматься

  • Сформировать SLI/SLO для критичных пользовательских сценариев совместно с бизнесом и техническими командами и внедрить контроль их соблюдения.
  • Развивать мониторинг на базе Grafana, Prometheus, Zabbix и CloudWatch; проектировать информативные дашборды, улучшать алерты и снижать шум событий.
  • Развивать централизованные логи в CloudWatch Logs и распределённую трассировку: расширять применение OpenTelemetry и оценивать использование AWS X-Ray.
  • Прогнозировать нагрузку и потребность в ресурсах, выявлять узкие места и формировать рекомендации по масштабированию.
  • Участвовать в нагрузочных испытаниях вместе с отдельным специалистом и использовать результаты для Capacity Management.
  • Подключаться к production-инцидентам как технический эксперт, при необходимости координировать восстановление и регулярно проводить RCA.
  • Обеспечивать выполнение корректирующих действий по итогам RCA и превращать выводы из инцидентов в устойчивые изменения систем и процессов.
  • Отвечать за disaster recovery: определять и согласовывать RTO/RPO, контролировать резервное копирование, проводить тесты восстановления и проверять сценарии отказа AWS-региона.
  • Контролировать доступность внешних систем, самостоятельно взаимодействовать с поддержкой поставщиков, координировать устранение сбоев и контролировать выполнение SLA.
  • Участвовать во внутренних аудитах, учитывать требования регуляторов и обеспечивать корректную работу с персональными данными.

Что для нас важно

  • Не менее трёх лет опыта в роли SRE, DevOps или Infrastructure Engineer и готовность работать на уровне Senior.
  • Практический опыт построения и развития процессов Monitoring & Event Management, Availability & Capacity Management и observability.
  • Опыт определения SLI/SLO и внедрения измеримых целей надёжности.
  • Уверенная работа с AWS, Kubernetes и Terraform в production-среде.
  • Практический опыт администрирования и настройки Grafana и Zabbix; понимание Prometheus и CloudWatch.
  • Понимание метрик, логов и распределённой трассировки, а также умение выстраивать диагностику сложных сбоев.
  • Глубокое понимание Linux, сетевых протоколов и принципов работы распределённых систем.
  • Опыт incident response, RCA и контроля выполнения корректирующих действий.
  • Способность создавать поддерживаемые инструменты автоматизации, скрипты и интеграции; конкретный язык программирования не принципиален.
  • Практическое владение инструментами, в том числе AI, для написания и ревью кода, анализа логов и инцидентов, подготовки RCA, runbook и работы с инфраструктурой с обязательной проверкой результатов перед применением в production.
  • Свободный русский и английский не ниже B2: предстоит регулярно общаться с мексиканскими коллегами, партнёрами и вендорами.

Будет плюсом

  • Опыт эксплуатации multi-region инфраструктуры и подготовки сценариев регионального отказа.
  • Опыт мониторинга мобильных приложений и внешних финансовых интеграций.
  • Практический опыт внедрения OpenTelemetry или AWS X-Ray.
  • Опыт работы в финтехе и понимание требований PCI DSS.
  • Опыт взаимодействия с регуляторами и участия в технических аудитах.


Посмотрите похожие вакансии

Senior SRE/DevOps Engineer
Компания: Skyeng
Зарплата: з.п. не указана
Senior SRE инженер
Компания: BETBOOM
Зарплата: з.п. не указана
Senior SRE-инженер (Nginx/Envoy)
Компания: VK
Зарплата: з.п. не указана
Senior SRE-Инженер
Компания: UZUM TECHNOLOGIES
Зарплата: з.п. не указана