Инженер вычислительного кластера (HPC) (удаленная работа)

18 августа 2026

Уровень зарплаты:
з.п. не указана
Требуемый опыт работы:
Не указан

Вакансия: Инженер вычислительного кластера (HPC)

Описание вакансии

Чем предстоит заниматься:
  • Устанавливать, конфигурировать и вводить в эксплуатацию CPU- и GPU-серверы;
  • Проводить диагностику оборудования, обновлять прошивки, настраивать BIOS/BMC и тестировать компоненты;
  • Устанавливать и сопровождать Linux на управляющих и вычислительных узлах;
  • Подключать новые серверы и вычислительные узлы к Slurm-кластеру;
  • Настраивать и сопровождать разделы, очереди, лимиты, квоты и учет использования ресурсов;
  • Диагностировать проблемы запуска и выполнения вычислительных заданий;
  • Устанавливать и обновлять драйверы, системные библиотеки и вычислительное программное обеспечение;
  • Создавать и сопровождать пользовательские программные и контейнерные окружения;
  • Автоматизировать установку операционных систем, настройку серверов и развертывание инфраструктурных сервисов;
  • Поддерживать инфраструктурные конфигурации в системе контроля версий;
  • Настраивать мониторинг оборудования, операционных систем, сетей, хранилищ и сервисов Slurm;
  • Участвовать в настройке централизованного логирования и оповещений;
  • Реагировать на инфраструктурные инциденты, локализовать причины сбоев и участвовать в их устранении;
  • Поддерживать резервное копирование критических конфигураций и сервисов;
  • Настраивать сетевое взаимодействие между управляющими узлами, вычислительными серверами и системами хранения;
  • Участвовать в эксплуатации файловых систем и хранилищ данных;
  • Контролировать состояние и загрузку CPU-, GPU-, сетевых и storage-ресурсов;
  • Участвовать в тестировании новых конфигураций оборудования и системного программного обеспечения;
  • Помогать внутренним командам переносить вычислительные задачи в общий HPC-контур;
  • Помогать пользователям диагностировать проблемы с вычислительными окружениями и заданиями;
  • Участвовать в интеграции HPC-инфраструктуры с внутренней вычислительной платформой;
  • Вести техническую документацию по оборудованию, конфигурациям и эксплуатационным процедурам.
Что мы ожидаем:
  • Уверенный практический опыт администрирования Linux;
  • Опыт эксплуатации физических серверов;
  • Понимание устройства серверных платформ, CPU, GPU, оперативной памяти, дисковых и сетевых подсистем;
  • Практический опыт работы со Slurm или другим планировщиком вычислительных задач;
  • Понимание основных принципов работы компьютерных сетей и систем хранения данных;
  • Опыт автоматизации инфраструктуры с помощью Ansible или аналогичных инструментов;
  • Навыки написания скриптов на Bash или Python;
  • Опыт работы с системами мониторинга и логирования;
  • Понимание контейнерных технологий;
  • Умение диагностировать проблемы на уровнях оборудования, операционной системы, сети, драйверов и Slurm;
  • Готовность работать как с автоматизацией, так и непосредственно с физическим оборудованием;
  • Аккуратность при выполнении инфраструктурных изменений;
  • Умение самостоятельно доводить инженерные задачи до работающего результата;
  • Способность документировать выполненные работы и передавать знания команде.