Инженер вычислительного кластера (HPC) (удаленная работа)
18 августа 2026
Уровень зарплаты:
з.п. не указана
з.п. не указана
Требуемый опыт работы:
Не указан
Не указан
Вакансия: Инженер вычислительного кластера (HPC)
Описание вакансии
Чем предстоит заниматься:- Устанавливать, конфигурировать и вводить в эксплуатацию CPU- и GPU-серверы;
- Проводить диагностику оборудования, обновлять прошивки, настраивать BIOS/BMC и тестировать компоненты;
- Устанавливать и сопровождать Linux на управляющих и вычислительных узлах;
- Подключать новые серверы и вычислительные узлы к Slurm-кластеру;
- Настраивать и сопровождать разделы, очереди, лимиты, квоты и учет использования ресурсов;
- Диагностировать проблемы запуска и выполнения вычислительных заданий;
- Устанавливать и обновлять драйверы, системные библиотеки и вычислительное программное обеспечение;
- Создавать и сопровождать пользовательские программные и контейнерные окружения;
- Автоматизировать установку операционных систем, настройку серверов и развертывание инфраструктурных сервисов;
- Поддерживать инфраструктурные конфигурации в системе контроля версий;
- Настраивать мониторинг оборудования, операционных систем, сетей, хранилищ и сервисов Slurm;
- Участвовать в настройке централизованного логирования и оповещений;
- Реагировать на инфраструктурные инциденты, локализовать причины сбоев и участвовать в их устранении;
- Поддерживать резервное копирование критических конфигураций и сервисов;
- Настраивать сетевое взаимодействие между управляющими узлами, вычислительными серверами и системами хранения;
- Участвовать в эксплуатации файловых систем и хранилищ данных;
- Контролировать состояние и загрузку CPU-, GPU-, сетевых и storage-ресурсов;
- Участвовать в тестировании новых конфигураций оборудования и системного программного обеспечения;
- Помогать внутренним командам переносить вычислительные задачи в общий HPC-контур;
- Помогать пользователям диагностировать проблемы с вычислительными окружениями и заданиями;
- Участвовать в интеграции HPC-инфраструктуры с внутренней вычислительной платформой;
- Вести техническую документацию по оборудованию, конфигурациям и эксплуатационным процедурам.
- Уверенный практический опыт администрирования Linux;
- Опыт эксплуатации физических серверов;
- Понимание устройства серверных платформ, CPU, GPU, оперативной памяти, дисковых и сетевых подсистем;
- Практический опыт работы со Slurm или другим планировщиком вычислительных задач;
- Понимание основных принципов работы компьютерных сетей и систем хранения данных;
- Опыт автоматизации инфраструктуры с помощью Ansible или аналогичных инструментов;
- Навыки написания скриптов на Bash или Python;
- Опыт работы с системами мониторинга и логирования;
- Понимание контейнерных технологий;
- Умение диагностировать проблемы на уровнях оборудования, операционной системы, сети, драйверов и Slurm;
- Готовность работать как с автоматизацией, так и непосредственно с физическим оборудованием;
- Аккуратность при выполнении инфраструктурных изменений;
- Умение самостоятельно доводить инженерные задачи до работающего результата;
- Способность документировать выполненные работы и передавать знания команде.
