Инженер данных
Уровень зарплаты: от 300 000 руб.
Местоположение: Россия, Санкт-Петербург и область (МСК +0ч)
Резюме: Инженер данных
Инженер данныхReal Deal
ОАЭ, Дубай
2025 - 2026
Обязанности и достижения:
Проект: REST API для геопространственной аналитики
- Разработал REST API для геопространственной аналитики на базе FastAPI, обеспечивающий доступ к данным об административных единицах и организациях.
- Реализовал пространственные запросы и обработку геометрий с использованием PostgreSQL + PostGIS.
- Разработал API-эндпоинты для получения административных единиц различных уровней, включая границы территорий, площадь и пространственные идентификаторы.
- Реализовал аналитические показатели по административным территориям: численность и плотность населения, численность работающего населения, количество филиалов организаций и производные бизнес-метрики.
- Разработал REST API для поиска и фильтрации организаций по категориям и подкатегориям с поддержкой пагинации.
- Реализовал получение детальной информации об организациях, включая географические координаты, принадлежность к административным единицам и бизнес-метрики.
- Разработал API для работы с иерархией категорий и подкатегорий организаций.
- Реализовал слой доступа к базе данных с использованием SQLAlchemy Core и оптимизированных SQL-запросов.
- Организовал загрузку и первоначальную обработку исходных данных с использованием Python.
- Контейнеризировал приложение и окружение базы данных с использованием Docker и Docker Compose.
- Реализовал health-check API и проверку доступности базы данных для мониторинга состояния сервиса.
Технологии:
Python, FastAPI, PostgreSQL, PostGIS, SQLAlchemy Core, REST API, SQL, Docker, Docker Compose, Uvicorn
Инженер данных
Национальный исследовательский технологический университет «МИСиС», Научный центр больших данных
Москва
2024 - 2025
Обязанности и достижения:
Проект: Система обработки потоковых данных
- Разработал ETL-конвейеры для обработки нескольких потоков данных в реальном времени.
- Реализовал механизм буферизации и партиционирования данных в HDFS.
- Рефакторинг legacy-кода на Python и Scala в соответствии с новыми алгоритмами и библиотеками.
- Оптимизировал Spark-задачи для stateful-обработки, снизив задержки и повысив пропускную способность.
- Настроил мониторинг конвейеров с использованием Prometheus + Grafana.
- Разработал систему оповещения об аномалиях с использованием Spark Mllib.
- Организовал долгосрочное хранение обработанных данных в Apache HDFS.
- Писал модульные и интеграционные тесты с использованием PyTest в соответствии с подходом TDD.
- Развертывал системы в Docker-контейнерах для обеспечения масштабируемости и отказоустойчивости.
Технологии:
Scala, Python, Apache Hadoop (HDFS, Spark, Kafka), PyTest, Airflow, Docker, Prometheus, Grafana, Bash
Инженер данных
Центр аналитики больших данных Университета ОАЭ (UAEU)
2023 - 2024
Обязанности и достижения:
Проект: ML-платформа для медицинских данных
- Разработал ETL-процессы для консолидации данных из множества источников (DICOM, EHR, временные ряды) в единое хранилище на PostgreSQL.
- Автоматизировал очистку и трансформацию данных (с использованием Python, PL/pgSQL).
- Создал систему аудита для отслеживания всех трансформаций (логирование изменений).
- Разработал REST API (на FastAPI) для интеграции с внешними системами.
- Оптимизировал SQL-запросы для аналитических отчетов (повысил производительность).
- Разработал сквозную ML-систему для классификации и прогнозирования.
- Участвовал в работах по сопровождению и тестированию системы.
Технологии:
Python (Pandas, NumPy), Scala, Spark, Hadoop, ClickHouse, PostgreSQL, REST (FastAPI), Postman, Tensorflow, Docker, Airflow
Инженер данных
АО «Силовые машины»
Санкт-Петербург
2019 - 2021
Обязанности и достижения:
Проект: IoT-конвейер для аналитики данных с умных счетчиков
- Разработал Kafka-продюсер (Python) для приема IoT-данных с умных счетчиков из JSON-файлов.
- Создал Spark ETL-задачи для трансформации и анализа данных.
- Реализовал модульные тесты для PySpark-задач, повысив надежность кода.
- Создал Airflow DAG для автоматизации задач конвейера (планирование, валидация данных).
- Интегрировал Trino с Kafka/Hive для выполнения федеративных SQL-запросов к потоковым и хранимым данным.
- Спроектировал и развернул мультисервисную архитектуру с использованием Docker Compose.
- Управлял Docker-образами (кастомные сборки для Airflow, Hive Metastore).
- Писал Bash-скрипты для развертывания и остановки окружений.
- Поддерживал конфигурации Hadoop/Spark (XML-файлы) для облачного хранилища (MinIO).
Технологии:
Python, SQL, Spark, Kafka, Airflow, Trino, Hive, MinIO (S3), PostgreSQL, Docker, Kafdrop, JupyterLab, PyTest, Bash
Инженер данных
ФГУП «НАМИ»
Москва
2014 - 2017
Обязанности и достижения:
Проект: Исследования и разработка электромобилей
- Проектировал и развертывал конвейеры обработки данных в реальном времени для испытательных стендов гибридных транспортных средств, обеспечивая низкую задержку при работе с данными датчиков (напряжение, ток, температура) и телеметрии.
- Реализовал решения для потоковой передачи данных (Apache Kafka, Spark Structured Streaming) для анализа временных рядов данных электронного блока управления (ECU) транспортного средства.
- Создал автоматизированные ETL-процессы (Python, PySpark) для валидации и стандартизации данных со испытательных стендов.
- Разрабатывал дашборды для визуализации (Grafana, Power BI) для отслеживания ключевых метрик (энергоэффективность, выбросы, крутящий момент) для инженерных команд.
Технологии:
Python, SQL, Spark, Kafka, Grafana, Power BI
Посмотрите похожие резюме
Оператор ввода данных
Зарплата: 70 000 руб.
Зарплата: 70 000 руб.
Специалист по работе с данными / Оператор баз данных
Зарплата: 80 000 руб.
Зарплата: 80 000 руб.
Инженер
Зарплата: 120 000 руб.
Зарплата: 120 000 руб.
Старший инженер по автоматизации тестирования
Зарплата: 360 000 руб.
Зарплата: 360 000 руб.
