Резюме: Системный администратор
Что я делал.
Проектирование и поддержка системы мониторинга для 100+ серверов (bare-metal и виртуальных машин).
Администрирование Zabbix (сбор метрик, триггеры, LLD) и Prometheus (сбор метрик с Docker).
Настройка экспортеров: Node Exporter, Blackbox Exporter, cAdvisor.
Создание и оптимизация дашбордов в Grafana для команд эксплуатации и руководства.
Настройка правил алертинга (Zabbix + Alertmanager), интеграция с Telegram/Slack.
Участие в устранении инцидентов (On-call), анализ первопричин сбоев.
Взаимодействие с DevOps-командой для внедрения мониторинга в CI/CD
Достижения
Ускорил онбординг новых серверов в 2 раза: переписал шаблоны для legacy-инфраструктуры на Zabbix с использованием LLD , избавившись от ручной прописки хостов.
Повысил прозрачность инфраструктуры: объединил метрики из Zabbix и Prometheus в единые дашборды Grafana, что позволило командам видеть полную картину без переключения интерфейсов.
Оптимизировал ресурсы: переработал политики хранения метрик (history/trends), снизив нагрузку на базу данных Zabbix на 20% и сэкономив место на дисках.
Снизил уровень шума в алертах: внедрил фильтрацию ложных срабатываний и эскалацию уведомлений по приоритетам.
Системы мониторинга: Zabbix (Advanced), Prometheus, Grafana, Alertmanager.
ОС и Скриптинг: Linux (Ubuntu, CentOS), Bash, Python (библиотеки requests, pynag).
Контейнеры: Docker, Docker Compose, Kubernetes (базовый уровень).
Базы данных: PostgreSQL (для Zabbix), InfluxDB (для Prometheus).
Протоколы: SNMP, HTTP/S, TCP/IP, DNS.
Инструменты: Git, Jira, Telegram Bot API.