Data scientist
Уровень зарплаты: от 80 000 руб.
Местоположение: Россия, Санкт-Петербург и область (МСК +0ч)
Резюме: Data scientist
Личные качества и достижения• Фундаментальная математическая база: Глубокие знания в области математической статистики, теории вероятностей и численных методов. Окончил направление «Прикладная математика и информатика» со средним баллом 5.0.
• Научные достижения & Награды: Стипендиат Альфа-Банка (2025–2026). Автор патента на программу и базу данных. Автор научной статьи по математическому моделированию. Регулярно выступаю на конференциях с публикациями тезисов (тематики: CV, NLP, математическое моделирование), участник олимпиад.
— Ozon ML Contest: Автоматическое выявление поддельных товаров по мультимодальным данным (контроль качества). Есть сертификат.
— Отбор в «Контур»: Разработал декодировщик и построил модель распознавания кода Морзе (Kaggle notebook).
— Отбор ЦФТ (кредитный скоринг): 12 место из 130 участников.
Опыт реализации проектов под ключ: RAG-система поиска по документации (e5-base + FAISS + reranking), гибридный ML/NLP-прогнозировщик цен акций (LLM + LSTM), CV-системы мониторинга (детекция СИЗ на базе RT-DETR/YOLO, занятость столов, умная парковка) и решения задач медицинского CV/сегментации.
Профессиональные навыки
• Python & Разработка: Уверенное владение Python и ключевыми библиотеками для научных вычислений (NumPy, SciPy). Отличное знание баз алгоритмов и структур данных, уверенное алгоритмическое мышление (опыт реализации классических алгоритмов с нуля). Понимание принципов ООП в Python. Написание чистого, читаемого и структурированного кода для задач аналитики, Data Science и ML.
• Визуализация данных & EDA: Проведение полноценного исследовательского анализа данных (EDA), очистка и предобработка датасетов, проверка статистических гипотез, анализ распределений. Построение понятных и информативных графиков с использованием Matplotlib и Seaborn.
• Работа с данными & Pandas: Глубокая обработка табличных данных и выборка любой сложности через Pandas (сложные группировки, агрегации, оконные трансформации, сводные таблицы). Понимание внутренней логики фильтрации и объединения данных на уровне, аналогичном SQL.
• A/B-тестирование: Проведение статистических экспериментов — формулировка гипотез, выбор метрик, расчет мощности и размера выборки, оценка статистической значимости результатов.
• Power BI & Дашборды: Разработка интерактивных дашбордов и бизнес-отчетов в Power BI для наглядного отслеживания метрик и презентации результатов EDA.
• SQL & Базы данных:
— Проектирование и архитектура: Проектирование реляционных БД с нуля (нормализация до 3НФ, настройка связей, индексов и триггеров) на примере предметной области «Сеть розничных магазинов».
— Аналитические запросы: Написание сложных SQL-запросов (JOINs, подзапросы, GROUP BY, HAVING, агрегатные и оконные функции). Практика подтверждена прохождением SQL Simulator (karpov.courses).
— Распределенные БД (Greenplum): Понимание архитектуры MPP-систем (Master/Segment nodes), базовые навыки работы с распределенными таблицами (DISTRIBUTED BY, шардирование, оптимизация аналитических запросов).
• Machine Learning (ML Base): Классический ML для табличных данных. Уверенное владение алгоритмами градиентного бустинга (CatBoost, XGBoost, LightGBM) и классическими моделями Scikit-Learn. Понимание алгоритмов.
• Computer Vision (CV): Разработка и обучение моделей глубокого обучения (PyTorch, TensorFlow/Keras). Работа с фреймворками детекции и сегментации (Ultralytics: YOLOv3–v11, RT-DETR). Сегментация медицинских изображений.
• NLP & RAG-системы:
— RAG-пайплайны: Проектирование систем поиска по технической документации (PDF до 500 стр.): парсинг, очистка, семантическое чанкование с метаданными.
— Retrieval & Reranking: Построение векторного поиска (multilingual-e5-base + FAISS), интеграция Cross-Encoder Reranking и PageWindow-подхода. Оценка качества по Recall@k и Precision@k.
— LLM & Датасеты: Сбор, валидация и подготовка мультиязычных датасетов для файнтюнинга LLM. Синтетическая генерация ответов с помощью сторонних LLM.
• Excel & Google Sheets: Ad-hoc экспресс-анализ сырых данных, расчет показателей описательной статистики, корреляционный анализ. Построение сводных таблиц с вычисляемыми полями и сложных формул. Построение гистограмм распределения, трендов и графиков динамики.
• Системы контроля версий (Git): Уверенное владение Git, опыт работы с удаленными репозиториями (GitHub, GitLab), управление ветками, коммиты и совместная разработка.
• Администрирование ОС (Linux / Windows): Опыт работы в Unix-подобных системах (Linux) и Windows. Работа с bash-терминалом и командной строкой: развертывание виртуальных окружений, управление процессами, автоматизация скриптов и запуск ML-инференса.
• Инфраструктура & DevOps: Git, Docker, Prometheus + Grafana, Blackbox Exporter.
• Сети & Системное администрирование: Стек TCP/IP, NAT, DNS, DHCP, маршрутизация, Active Directory/LDAP, настройка сетевого оборудования и периферии.
• Другие языки & Среды вычислений:
— Wolfram Language (Mathematica): Математическое моделирование, символьные и численные вычисления, факторный анализ и построение графических иллюстраций.
— MATLAB: Реализация численных методов (линейная алгебра, численное интегрирование и дифференцирование), обработка сигналов и визуализация результатов.
— C++ & R: Понимание ООП и базовый синтаксис C++; использование R для моделирования и решения задач оптимизации, статистического анализа и работы с распределениями.
— Разработка 1С: проектирование конфигураций с нуля (регистры, документы, курсовой проект «Учет сборки»), встроенный язык (контроль остатков, валидация), сложные запросы и СКД, внешние обработки, обмен данными (XML, CSV), механизм расширений, настройка ролей.
Посмотрите похожие резюме
AI/ML-engineer
Зарплата: 200 000 руб.
Зарплата: 200 000 руб.
Руководитель проектов
Зарплата: 200 000 руб.
Зарплата: 200 000 руб.
Менеджер по работе с маркетплейсами
Зарплата: 60 000 руб.
Зарплата: 60 000 руб.
ML-инженер / Data Scientist
Зарплата: 400 000 руб.
Зарплата: 400 000 руб.
