SRE инженер (1С) / Инженер по надёжности информационных систем (1C) (удаленная работа)

1 октября 2026

Уровень зарплаты:
з.п. не указана
Требуемый опыт работы:
Не указан

Вакансия: SRE инженер (1С) / Инженер по надёжности информационных систем (1C)

Описание вакансии

Мы ищем специалиста, который обеспечит стабильную и предсказуемую работу наших информационных систем на базе 1С и MS SQL. Ваша главная цель не просто чинить , а системно повышать надёжность: внедрять метрики, автоматизировать обнаружение проблем, проектировать отказоустойчивость и устранять первопричины сбоев. Роль предполагает выделение до 10 % времени команд на задачи по надёжности и улучшению процессов.

Тебе предстоит:

Управление инцидентами и постмортемы

  • Координировать участников пожарной команды для оперативного решения критических инцидентов.
  • Собирать информацию о проблеме, контролировать заведение аварии, фиксировать хронометраж и ключевые действия.
  • Писать постмортем отчёты (blameless postmortem): фиксировать, что произошло, как реагировали, какие уроки извлечены.
  • Контролировать и ставить задачи по недопущению повторения причин инцидентов (RCA, action items).

Производительность и доступность

  • Определять и поддерживать SLI/SLO для ключевых сервисов, вести учёт error budget.
  • Настраивать и анализировать ключевые показатели ИС: создавать дашборды, алерты, описывать реакцию на отклонения.
  • Писать инструкции (runbooks) по реакции на отклонения показателей работы от нормы.
  • Анализировать аномалии: рост нагрузки, рост данных, нехарактерные паттерны поведения системы.

Анализ логов и диагностика

  • Анализировать Журнал регистрации (ЖР) и Технологический журнал (ТЖ) на наличие ошибок и узких мест.
  • Сопоставлять данные из разных источников (логи, метрики, трейсы) для точной локализации проблемы.

Масштабирование и отказоустойчивость

  • Участвовать в проектировании и реализации отказоустойчивой архитектуры (кластеризация 1С, Always On для MS SQL, балансировка нагрузки и т. д.).
  • Готовить систему к пиковым нагрузкам: нагрузочное тестирование, планирование ёмкости, проработка сценариев деградации.

Регулярное обслуживание и гигиена данных

  • Выполнять и автоматизировать типовые операции обслуживания: пересчёт итогов, очистка регистров, удаление нулевых записей.
  • Ставить задачи и предлагать решения, чтобы такие операции требовались реже или выполнялись автоматически.

Пожелания по опыту:

  • Опыт разработки на платформе 1С: понимание архитектуры регистров, сеансов, блокировок, умение читать ЖР и ТЖ.
  • Уверенная работа с MS SQL: планы запросов, блокировки, DMV, Extended Events, тюнинг производительности.
  • Практический опыт работы с инструментами мониторинга и наблюдаемости: Zabbix, Prometheus, Grafana, ELK.
  • Понимание SRE практик: SLI/SLO, error budget, incident management, blameless postmortem, runbooks.
  • Умение проектировать отказоустойчивые и масштабируемые решения, опыт подготовки к пиковым нагрузкам.
  • Способность формализовать процессы, писать понятные инструкции и ставить задачи смежным командам.

Будет плюсом

  • Опыт внедрения автоматизации для типовых операций обслуживания.
  • Знание практик Capacity Planning и Chaos Engineering на базовом уровне.
  • Опыт работы в кросс функциональных командах и проведения ретроспектив по инцидентам.