Middle ML Engineer TTS (удаленная работа)
17 сентября 2026
от 100 000 до 200 000 руб.
Не указан
Вакансия: Middle ML Engineer TTS
Описание вакансии
Добрый день!
Мы Sasha AI , пионеры в разработке голосовых AI-агентов. Наша платформа позволяет запустить искусственный интеллект, который общается с клиентами по телефону и приносит выручку без операторов.
Мы выросли в 5 раз за год , а наша цель на 2026-й оборот 400 млн .
Наша маленькая цель: сделать передовую AI-технологию простой, окупаемой и доступной каждому крупному бизнесу.
Наша большая цель за 10 лет построить монополиста, ассоциирующегося с искусственным интеллектом в России .
Голос первое, что слышит клиент. Если синтез звучит роботом, неправильно ставит ударение или отвечает с задержкой, человек кладёт трубку. Мы ищем инженера, который возьмёт на себя синтез речи в нашем каскаде STT LLM TTS: от данных и дообучения до быстрого инференса и мониторинга в продакшене.
Чем предстоит заниматься
- Дообучать современные TTS-модели под русскую диалоговую речь, в первую очередь LLM-based, LoRA/QLoRA, full fine-tuning, выравнивание по предпочтениям (DPO) для естественности звучания.
- Строить пайплайны данных для обучения:
- сбор аудио из реальных звонков и студийных записей;
- очистка, сегментация, выравнивание текста и аудио;
- фильтрация по качеству, автоматическая разметка.
- Развивать фронтенд синтеза: нормализация текста (числа, даты, адреса, телефоны), ударения и омографы, G2P.
- Оптимизировать инференс: квантизация, стриминговый синтез, минимальное время до первого звука, высокая плотность потоков на GPU (vLLM, ONNX, TensorRT).
- Встраивать TTS в каскад: стыковка с LLM (формат ответа, стриминг по токенам), обработка перебиваний, адаптация к телефонному каналу (8 кГц, G.711/Opus).
- Строить наблюдаемость синтеза в продакшене: трейсинг через OpenTelemetry, метрики latency и RTF в Prometheus, дашборды в Grafana, отлов деградаций.
- Выстраивать оценку качества:
- MOS/CMOS-тесты;
- автоматические метрики (UTMOS, CER через ASR, speaker similarity);
- регрессионные прогоны;
- связь с доходимостью разговоров.
- Создавать новые голоса и адаптировать синтез под клиентов (voice cloning).
Что мы ждём
- Коммерческий опыт от 1 года в ML и дообученные модели, доведённые до продакшена.
- Опыт дообучения трансформерных или LLM-моделей: LoRA/QLoRA, SFT, желательно DPO.
- Уверенный Python, PyTorch, Hugging Face (Transformers, PEFT).
- Опыт квантизации и оптимизации моделей под ограниченные ресурсы и низкую задержку.
- Умение собирать и валидировать датасеты для обучения.
- Понимание, как устроен голосовой каскад STT LLM TTS и где в нём теряется время.
- Опыт с Docker, CI/CD, развёртыванием и мониторингом ML-сервисов.
- Желание глубоко погрузиться в синтез речи.
Будет плюсом
- Опыт работы с TTS-моделями: обучение, дообучение или интеграция в продукт.
- Понимание нейрокодеков (EnCodec, DAC, SNAC, Mimi) и вокодеров (HiFi-GAN, Vocos).
- Базовые знания цифровой обработки сигналов: спектрограммы, mel, частота дискретизации.
- C++ для оптимизации критичных по производительности компонентов, опыт потоковой обработки данных.
- Опыт с Airflow, ClickHouse, Kafka для работы с большими объёмами аудио и метаданных.
- Сильная математическая или физическая база.
Что мы предлагаем
- Синтез речи, который ежедневно звучит в тысячах живых разговоров, и видимый эффект в конверсии.
- Полный цикл: данные обучение оптимизация продакшен мониторинг.
- GPU и реальные данные для экспериментов.
- Небольшую команду без бюрократии и быстрый путь от идеи до релиза.
- Возможность вырасти до senior и взять направление TTS целиком.
Посмотрите похожие вакансии
Компания: Mesh Group
Зарплата: от 160 000 до 300 000 руб.
