Middle ML Engineer TTS (удаленная работа)

17 сентября 2026

Уровень зарплаты:
от 100 000 до 200 000 руб.
Требуемый опыт работы:
Не указан

Вакансия: Middle ML Engineer TTS

Описание вакансии

Добрый день!

Мы Sasha AI , пионеры в разработке голосовых AI-агентов. Наша платформа позволяет запустить искусственный интеллект, который общается с клиентами по телефону и приносит выручку без операторов.

Мы выросли в 5 раз за год , а наша цель на 2026-й оборот 400 млн .

Наша маленькая цель: сделать передовую AI-технологию простой, окупаемой и доступной каждому крупному бизнесу.

Наша большая цель за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России .

Голос первое, что слышит клиент. Если синтез звучит роботом, неправильно ставит ударение или отвечает с задержкой, человек кладёт трубку. Мы ищем инженера, который возьмёт на себя синтез речи в нашем каскаде STT LLM TTS: от данных и дообучения до быстрого инференса и мониторинга в продакшене.

Чем предстоит заниматься

  • Дообучать современные TTS-модели под русскую диалоговую речь, в первую очередь LLM-based, LoRA/QLoRA, full fine-tuning, выравнивание по предпочтениям (DPO) для естественности звучания.
  • Строить пайплайны данных для обучения:
    • сбор аудио из реальных звонков и студийных записей;
    • очистка, сегментация, выравнивание текста и аудио;
    • фильтрация по качеству, автоматическая разметка.
  • Развивать фронтенд синтеза: нормализация текста (числа, даты, адреса, телефоны), ударения и омографы, G2P.
  • Оптимизировать инференс: квантизация, стриминговый синтез, минимальное время до первого звука, высокая плотность потоков на GPU (vLLM, ONNX, TensorRT).
  • Встраивать TTS в каскад: стыковка с LLM (формат ответа, стриминг по токенам), обработка перебиваний, адаптация к телефонному каналу (8 кГц, G.711/Opus).
  • Строить наблюдаемость синтеза в продакшене: трейсинг через OpenTelemetry, метрики latency и RTF в Prometheus, дашборды в Grafana, отлов деградаций.
  • Выстраивать оценку качества:
    • MOS/CMOS-тесты;
    • автоматические метрики (UTMOS, CER через ASR, speaker similarity);
    • регрессионные прогоны;
    • связь с доходимостью разговоров.
  • Создавать новые голоса и адаптировать синтез под клиентов (voice cloning).

Что мы ждём

  • Коммерческий опыт от 1 года в ML и дообученные модели, доведённые до продакшена.
  • Опыт дообучения трансформерных или LLM-моделей: LoRA/QLoRA, SFT, желательно DPO.
  • Уверенный Python, PyTorch, Hugging Face (Transformers, PEFT).
  • Опыт квантизации и оптимизации моделей под ограниченные ресурсы и низкую задержку.
  • Умение собирать и валидировать датасеты для обучения.
  • Понимание, как устроен голосовой каскад STT LLM TTS и где в нём теряется время.
  • Опыт с Docker, CI/CD, развёртыванием и мониторингом ML-сервисов.
  • Желание глубоко погрузиться в синтез речи.

Будет плюсом

  • Опыт работы с TTS-моделями: обучение, дообучение или интеграция в продукт.
  • Понимание нейрокодеков (EnCodec, DAC, SNAC, Mimi) и вокодеров (HiFi-GAN, Vocos).
  • Базовые знания цифровой обработки сигналов: спектрограммы, mel, частота дискретизации.
  • C++ для оптимизации критичных по производительности компонентов, опыт потоковой обработки данных.
  • Опыт с Airflow, ClickHouse, Kafka для работы с большими объёмами аудио и метаданных.
  • Сильная математическая или физическая база.

Что мы предлагаем

  • Синтез речи, который ежедневно звучит в тысячах живых разговоров, и видимый эффект в конверсии.
  • Полный цикл: данные обучение оптимизация продакшен мониторинг.
  • GPU и реальные данные для экспериментов.
  • Небольшую команду без бюрократии и быстрый путь от идеи до релиза.
  • Возможность вырасти до senior и взять направление TTS целиком.


Посмотрите похожие вакансии

ML Engineer (Voice/TTS)
Компания: Voximplant
Зарплата: з.п. не указана
ML/DL Engineer (CV / VLM / LLM, AI-агенты)
Компания: Mesh Group
Зарплата: от 160 000 до 300 000 руб.
Middle Data Scientist, NLP, Ozon Банк
Компания: Ozon
Зарплата: з.п. не указана