DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB (удаленная работа)

9 сентября 2026

Уровень зарплаты:
з.п. не указана
Требуемый опыт работы:
Не указан

Вакансия: DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB

Описание вакансии

DevOps / SRE-инженер с экспертизой ClickHouse и MariaDB

Привет! Меня зовут Эля, я HR компании Амбрелла .
Мы аккредитованная IT-компания в сфере информационной безопасности. Развиваем высоконагруженную SIEM-платформу для сбора, хранения и обработки событий ИБ.
Сейчас ищем DevOps / SRE-инженера уровня Middle+/Senior с глубокой практической экспертизой по ClickHouse и уверенным опытом эксплуатации MariaDB .
Основной фокус роли промышленная эксплуатация ClickHouse: кластеры, репликация, шардирование, производительность, хранение больших объёмов данных, backup/restore, мониторинг, безопасность и безопасное проведение изменений в production.
Вторая важная зона MariaDB: эксплуатация, репликация, отказоустойчивость, Galera Cluster, backup/restore, disaster recovery, performance tuning и миграция с master-master-репликации на более надёжную кластерную архитектуру.
Нам нужен инженер, который умеет не просто поднять базу , а безопасно эксплуатировать production-инфраструктуру с критически важными данными: проверять гипотезы на стендах, оценивать риски, готовить rollback-план, участвовать в расследовании инцидентов и фиксировать результаты в документации.

Чем предстоит заниматься: ClickHouse:
Администрировать продуктивные и тестовые кластеры ClickHouse;
Контролировать состояние шардов, реплик, Distributed-таблиц и ReplicatedMergeTree-таблиц;
Диагностировать replication queue, merges, mutations, inserts, деградацию запросов и проблемы с дисковой подсистемой;
Анализировать системные таблицы ClickHouse и состояние кластера;
Участвовать в изменении топологии кластера: добавление шардов, реплик, серверов, изменение Distributed-таблиц;
Планировать горизонтальное масштабирование ClickHouse-кластера;
Оптимизировать схемы данных, партиционирование, ключи сортировки, TTL, индексы, storage policy и настройки сервера;
Работать с хранением данных: локальные диски, LUN, DAS, hot / warm storage, S3-совместимое хранилище;
Прорабатывать дедупликацию данных, повышение уровня сжатия и механизм токенизации / full text search по событиям;
Настраивать и сопровождать ClickHouse Keeper / ZooKeeper;
Настраивать TLS/SSL для клиентских подключений и межсерверного взаимодействия;
Разрабатывать и проверять backup/restore и disaster recovery;
Настраивать мониторинг, алерты и дашборды по ClickHouse;
Готовить Ansible playbooks / roles, runbook и, инструкции, чек-листы и технические отчёты.

MariaDB:
Администрировать продуктивные и тестовые инсталляции MariaDB;
контролировать состояние серверов, репликации, соединений, транзакций, блокировок и фоновых процессов;
Настраивать и сопровождать репликацию: master-slave, master-master, GTID-based replication;
Диагностировать replication lag, ошибки SQL thread / IO thread, рассинхронизацию данных и конфликты при master-master-схемах;
Участвовать в миграции MariaDB с master-master-репликации на Galera Cluster;
Настраивать, сопровождать и диагностировать Galera Cluster;
Прорабатывать HA-архитектуру MariaDB: failover, fencing, VIP / proxy layer, split-brain-риски;
Разрабатывать и проверять disaster recovery-сценарии, RPO / RTO и восстановимость резервных копий;
Анализировать производительность: slow queries, EXPLAIN, индексы, locks, deadlocks, buffer pool, connection pool, disk IO;
Оптимизировать конфигурацию MariaDB с учётом нагрузки, объёма данных, RAM, CPU, дисковой подсистемы и сети;
Настраивать TLS/SSL для клиентских подключений и репликации;
Настраивать мониторинг, алерты, дашборды и runbook и по MariaDB.

Production, автоматизация и взаимодействие:
Участвовать в расследовании production-инцидентов, связанных с ClickHouse, MariaDB, Linux, сетью или дисковой подсистемой;
Анализировать метрики, логи, системные таблицы, состояние репликации, блокировки, диски, сеть и конфигурации;
Формулировать технические гипотезы, проверять их и отделять первопричину от сопутствующих факторов;
Готовить технические выводы по итогам инцидентов и участвовать в postmortem-разборах;
Разворачивать тестовые стенды ClickHouse и MariaDB для проверки архитектурных решений;
Проверять обновления, изменение топологии, расширение хранилища, storage policy и параметры ClickHouse / MariaDB до применения в production;
Автоматизировать типовые операции через Ansible / Bash / Python / Terraform или аналогичные инструменты;
Взаимодействовать с заказчиками, объяснять технические риски понятным языком, предлагать решения и лидировать технические обсуждения.

Обязательные требования:
Практический опыт промышленной эксплуатации ClickHouse;
Понимание архитектуры ClickHouse: shards, replicas, Distributed tables, ReplicatedMergeTree, MergeTree family;
Опыт диагностики replication queue, merges, mutations, insert/select latency, деградации запросов и проблем с дисковой подсистемой;
Понимание партиционирования, ключей сортировки, TTL, storage policies, disks, volumes, data skipping indexes;
Опыт изменения топологии ClickHouse-кластера или глубокое понимание порядка и рисков таких изменений;
Опыт настройки TLS/SSL для ClickHouse;
Опыт эксплуатации MariaDB в продуктивной или близкой к продуктивной среде;
Понимание MariaDB, InnoDB, транзакций, индексов, блокировок, deadlocks, isolation levels;
Опыт настройки и диагностики репликации MariaDB;
Понимание GTID, binary logs, relay logs, replication lag, failover и рисков master-master-репликации;
Опыт настройки backup/restore MariaDB и проверки восстановимости резервных копий;
Опыт диагностики производительности MariaDB: slow query log, EXPLAIN, индексы, locks, buffer pool, disk IO;
Опыт эксплуатации Linux-серверов;
Понимание влияния CPU, RAM, disk IO, network и filesystem на работу ClickHouse и MariaDB;
Опыт настройки мониторинга и алертов для ClickHouse, MariaDB и инфраструктуры;
Опыт работы с Prometheus, Grafana, Zabbix или аналогичными системами мониторинга;
Опыт автоматизации через Ansible, Bash, Python или аналогичные инструменты;
Умение аккуратно проводить изменения в production: план работ, оценка рисков, rollback-план, проверка результата;
Умение писать техническую документацию: инструкции, runbook и, чек-листы, postmortem-отчёты.

Желательные требования:
Опыт или уверенное понимание Galera Cluster;
Опыт эксплуатации ClickHouse и MariaDB в составе SIEM, SOC, log management, observability, telemetry или других высоконагруженных систем;
Опыт работы с большими объёмами данных: десятки или сотни ТБ;
Опыт работы с ClickHouse Keeper или ZooKeeper;
Опыт эксплуатации ClickHouse / MariaDB на bare metal;
Опыт работы с LUN, DAS, локальными дисковыми массивами и S3-совместимыми объектными хранилищами;
Опыт нагрузочного тестирования ClickHouse и MariaDB;
Опыт построения процедур disaster recovery;
Опыт подготовки архитектурных и эксплуатационных документов для заказчиков;
Опыт работы с ProxySQL, MaxScale, HAProxy, Keepalived, Pacemaker / Corosync или аналогичными решениями;
Опыт проведения регламентных работ с минимальным downtime;
Опыт аудита продуктивных инсталляций у заказчиков.

Что важно в кандидате:
Инженерная аккуратность и понимание рисков production-среды;
Умение сначала проверять гипотезы на стенде, а не сразу применять изменения в production;
Способность разбираться в сложных инцидентах на стыке приложения, БД, Linux, сети и дисковой подсистемы;
Клиентоориентированность и зрелая коммуникация;
Дисциплина: приходить на встречи вовремя, готовиться к ним, выполнять договорённости и заранее предупреждать о рисках;
Способность лидировать технические встречи, фиксировать решения и следующие шаги;
Готовность документировать решения и передавать знания команде.

Условия:
Постоянная занятость;
Работа с продуктивной, тестовой и лабораторной инфраструктурой;
Взаимодействие с командой эксплуатации, инженерами SIEM, разработчиками, архитекторами и техническими представителями заказчика;
Участие в планировании изменений, разборе инцидентов и развитии архитектуры хранения данных.

Всегда рады новым талантам и новым успехам наших сотрудников!