DevOps/Infrastructure Engineer (Matrix, self-hosted, KSA) (удаленная работа)
31 июля 2026
Уровень зарплаты:
от 300 000 до 300 000 руб.
от 300 000 до 300 000 руб.
Требуемый опыт работы:
Не указан
Не указан
Вакансия: DevOps/Infrastructure Engineer (Matrix, self-hosted, KSA)
Описание вакансии
Задачи:- Развёртывание платформы Matrix в изолированном (air-gapped) контуре заказчика в Kubernetes: Synapse + Synapse Workers, MAS, Element Web / Admin / Call, LiveKit, TURN/STUN, вспомогательные сервисы.
- Подготовка внутреннего реестра образов и внутренних репозиториев пакетов, установка без обращения к внешним ресурсам, отключение внешней телеметрии компонентов.
- Настройка четырёх контуров (dev / QA / UAT / prod) и CI/CD-пайплайнов сборки и выката, включая сборку и подпись форков клиентов (Web/Desktop, iOS, Android, Element Call, Element Admin) и собственный сервер обновлений.
- Хранение конфигурации в репозитории и единый способ её применения на все контуры (IaC / GitOps).
- Построение HA-конфигурации без единой точки отказа на двух compute-хостах и независимом quorum/witness-узле: PostgreSQL (Patroni, автопереключение, WAL-архивирование, PITR), Redis (Sentinel, AOF, eviction), S3-совместимое хранилище (MinIO/Ceph, шифрование at-rest, репликация между хостами), входной прокси (Nginx/HAProxy, минимум два экземпляра), LiveKit/TURN.
- Резервное копирование и DR: копии PostgreSQL с WAL, файлового хранилища, конфигураций и секретов в независимое зашифрованное хранилище; регулярные проверки восстановления с фиксацией фактических RPO/RTO (целевые: RPO 0 при одиночном отказе, RPO бэкапа 15 мин, RTO 4 ч).
- Разделение Synapse на специализированные воркеры (синхронизация, отправка событий, медиа, уведомления, фоновые задачи) и маршрутизация запросов на входном прокси; схема размещения процессов по узлам и горизонтальное масштабирование.
- Развёртывание и настройка серверной части звонков: LiveKit SFU, сервис выдачи токенов, TURN/STUN, прохождение корпоративных NAT и мобильных сетей, UDP-тракт и качество медиа.
- Интеграция корпоративной аутентификации на инфраструктурном уровне: MAS + OIDC, развёртывание и настройка IdP-моста (Keycloak / Authentik / Dex) для SAML/LDAP, MFA и правила сеансов.
- Развёртывание доверенного шлюза проверки файлов (matrix-content-scanner, ClamAV/YARA, адаптер ICAP к антивирусу заказчика), карантинного контура и media proxy.
- Мониторинг и наблюдаемость: метрики, журналы, дашборды Grafana, правила оповещений с покрытием Synapse, PostgreSQL, Redis, S3, LiveKit, TURN, входного прокси, очереди проверки файлов, SIEM-очереди и собственных сервисов; runbook-инструкции для дежурных.
- Доставка JSON-журналов аудита в SIEM заказчика: персистентная очередь, повторная отправка, контроль потерь, алертинг; неизменяемое (WORM) хранилище журналов с настраиваемым сроком хранения.
- Безопасность инфраструктуры: Zero-Trust и least privilege, шифрование внутренних соединений, default-deny NetworkPolicy, сегментация сети, контроль исходящих соединений с allowlist (только APNS/FCM и согласованные адреса), управление секретами и их ротация, hardening компонентов по чек-листу, сканирование уязвимостей и проверка конфигураций TLS / контейнеров / Kubernetes.
- Устранение SPOF и подтверждение его независимыми failover-сценариями по каждому компоненту (compute-хост, PostgreSQL, Redis, S3, LiveKit/TURN, входной прокси, хранилище журналов).
- Нагрузочное тестирование: базовый профиль 500 одновременно активных пользователей при 10 000 зарегистрированных (включая до 500 активных RTC-участников), резервный смешанный профиль на 750 пользователей; целевые p95 < 200 мс, доля ошибок < 1%; отчёты с p50/p95, throughput, error rate, CPU/RAM/disk IOPS/сеть по узлам.
- Формирование требований к оборудованию и BOM, настройка dev/QA/UAT в инфраструктуре заказчика в КСА, установка производственной платформы на площадке заказчика; после перевозки оборудования в закрытый ЦОД удалённый smoke test и проверка мониторинга (физического доступа к ЦОД нет).
- Подготовка стенда и документации для независимого пентеста, разбор находок, устранение подтверждённых критических уязвимостей поставки, ретест.
- Эксплуатационная документация на английском языке: инструкции развёртывания, обновления и отк та, runbook-и типовых аварий, регламент применения патчей; обучение системных администраторов, операторов и службы поддержки заказчика (train-the-trainer).
- Поддержка 3-й линии в течение 12 месяцев гарантийного периода: реагирование на сбои по SLA (P1 < 4 ч / P2 < 24 ч / P3 < 72 ч), обновления безопасности и патчи, эксплуатационные изменения инфраструктуры.
- Опыт в DevOps/SRE/инфраструктурной инженерии от 4 лет.
- Коммерческий опыт эксплуатации Matrix (Synapse/Dendrite/Element, MAS, Element Call/LiveKit) обязательно.
- Готовность к релокации в Саудовскую Аравию на 3 месяца (релокацию оплачиваем) обязательно.
- Kubernetes на уровне Senior : продакшн-эксплуатация, операторы, StatefulSet-нагрузки, NetworkPolicy, ingress, ресурсное планирование, отладка сетевого стека.
- Опыт развёртывания в изолированных (air-gapped, on-premise) контурах: внутренний реестр образов (Harbor / Nexus / аналог), внутренние репозитории пакетов, работа без доступа к публичным registry.
- IaC и GitOps: Helm, Kustomize, ArgoCD / FluxCD, Terraform и/или Ansible; конфигурация в репозитории и воспроизводимый выкат на несколько контуров.
- CI/CD: GitLab CI / GitHub Actions / Jenkins; сборка и подпись артефактов, продвижение по контурам dev QA UAT prod.
- Глубокий опыт с PostgreSQL: streaming replication, Patroni (или аналогичный механизм автопереключения), DCS/witness, WAL-архивирование и PITR, оптимизация под нагрузку, тестирование восстановления.
- Redis в HA-конфигурации: Sentinel / cluster / оператор, persistence (AOF), лимиты памяти и политики eviction, Pub/Sub как шина между воркерами.
- Объектное хранилище: MinIO / Ceph / S3, шифрование at-rest, репликация и резервирование, object lock / WORM, retention и контроль ёмкости.
- Nginx и/или HAProxy: терминация TLS 1.2/1.3, сертификаты корпоративного ЦС, балансировка, маршрутизация по эндпоинтам, rate limiting.
- Мониторинг и логирование: Prometheus / VictoriaMetrics, Grafana, Alertmanager, Loki / OpenSearch; проектирование алертов и написание runbook-ов.
- Резервное копирование и DR: проектирование схемы, независимые backup-таргеты, шифрование копий, регулярные restore-drill, работа с целевыми RPO/RTO.
- Уверенное администрирование Linux и сетей: VLAN, маршрутизация, межсетевые экраны, LACP/бондинг, диагностика на 25GbE, работа с гипервизорами (KVM / Proxmox / VMware) на железе заказчика.
- Информационная безопасность инфраструктуры: Zero-Trust и defense-in-depth на практике, mTLS между сервисами, default-deny сетевые политики, сегментация, контроль egress, управление секретами (Vault / Kubernetes Secret) и их ротация, hardening по CIS-бенчмаркам, сканирование образов и конфигураций (Trivy / Grype, kube-bench, testssl и аналоги).
- Понимание принципов E2EE и криптографии в объёме, достаточном для корректного проектирования контура (что сервер видит и не видит, где заканчиваются возможности серверной проверки, как устроено хранение и передача ключей).
- Опыт интеграции LDAP / AD и SSO (SAML 2.0 / OIDC) на стороне инфраструктуры: развёртывание и настройка Keycloak / Authentik / Dex или аналога.
- Нагрузочное тестирование: k6 / Locust / JMeter (или аналоги), построение профиля нагрузки, интерпретация p50/p95, поиск узких мест, подготовка отчётов.
- Python и/или Go на уровне чтения и правки чужого кода: конфигурация и патчи Synapse (Python/Twisted), LiveKit (Go), написание собственных скриптов, экспортеров и операторов автоматизации.
- Разговорный английский (проект международный, коммуникация с заказчиком, вся документация и обучение на английском).
-
Будет плюсом:
- Опыт эксплуатации WebRTC-инфраструктуры: SFU (LiveKit / Janus / mediasoup), coturn, NAT traversal, отладка медиатракта.
- Elasticsearch / OpenSearch.
- Опыт интеграции ICAP / антивирусных решений (ClamAV, YARA).
- Опыт с SIEM, compliance и аудитом (immutable/WORM-логи, доставка событий в SIEM заказчика).
- Опыт на международных enterprise / госпроектах с повышенными требованиями к ИБ и в закрытых контурах без доступа в интернет.
- Опыт подготовки инфраструктуры к внешнему пентесту и аудиту безопасности, устранения находок.
- Опыт формирования требований к оборудованию и BOM, приёмки и ввода в эксплуатацию on-premise-платформ.
- Опыт корпоративной дистрибуции мобильных приложений (MDM, Apple push-ключи, Firebase/FCM, собственный сервер обновлений desktop-клиентов).
- Сертификации CKA / CKS.
- Опыт работы на Ближнем Востоке или с арабоязычными заказчиками.
- Возможность трудоустройства в аккредитованной IT-компании в России.
- Гибкий график, офис в центре Екатеринбурга либо возможность удаленной работы.
- Работа с ведущими клиентами, международными проектами и современными технологиями.
- Компенсация за занятия английским языком, оплачиваем 50% от стоимости уроков.
- Больничный бюджет, который можно тратить на любые виды лечений и лекарств.
- Неограниченный доступ к консультациям штатного юриста по личным вопросам.
