Senior Research Engineer, синтез речи
SynthesiaEurope, UKОфис20 авг.
Synthesia — платформа для создания видео с помощью ИИ, используемая более чем 90% компаний из списка Fortune 100. Основана в 2017 году, штаб-квартира в Лондоне, офисы и команды в Европе и США. После раунда финансирования серии E в размере 200 млн долларов оценка компании составляет 4 млрд долларов. Общий объем привлеченного финансирования превышает 530 млн долларов от инвесторов, включая Accel, NVentures (венчурное подразделение Nvidia), Kleiner Perkins, GV и Evantic Capital, а также основателей и операторов Stripe, Datadog, Miro и Webflow.
В команде исследователей и инженеров (более 40 человек) в составе R&D-отдела вы будете работать над задачами в области генеративного ИИ, с фокусом на создание качественных, выразительных и работающих в реальном времени синтетических голосов. Работа связана с прикладной стороной исследовательских усилий и напрямую влияет на решения, используемые более чем 60 000 компаний по всему миру. Вы присоединитесь к команде Audio Post-Training, которая занимается генеративной речью и синтезом голоса, обеспечивая производственное качество, скорость и надежность внутренних голосовых моделей.
Типичные проекты:
- Разработка и оценка систем потоковой передачи и преобразования речи в речь для интерактивного синтеза голоса с низкой задержкой.
- Адаптация моделей под новые входные параметры (эмоции, скорость, просодия, управление диктором и т. д.).
- Внедрение методов пост-обучения (квантование, прунинг, дистилляция) для повышения эффективности и снижения задержки в генерации речи в реальном времени.
- Интеграция и тестирование новых архитектур, таких как нейронные кодеки, диффузионные модели или модели потокового согласования, для повышения реалистичности и отзывчивости.
- Участие в определении новых метрик оценки разговорной речи, включая системы прогнозирования MOS с учетом задержки.
- Отслеживание последних исследований в области аудиодиффузии, авторегрессионных моделей, нейронных кодеков и мультимодальных LLM.
- Применение DPO (Direct Preference Optimization) и дистилляции для точной настройки крупномасштабных речевых моделей.
Требования:
- Глубокое понимание генеративного моделирования, желательно применительно к последовательным или мультимодальным данным.
- Практический опыт работы с большими языковыми моделями (LLM) или аналогичными архитектурами на основе трансформеров.
- Высокий уровень владения PyTorch, включая опыт распределенного обучения и оптимизации моделей.
- Хорошее понимание моделирования временных рядов и токенизации, желательно в контексте аудио или речи.
- Подтвержденная способность быстро создавать прототипы, проверять гипотезы и эффективно итерировать.
- Опыт сквозного обучения моделей глубокого обучения — от подготовки данных до оценки.
- Сильные навыки разработки ПО, позволяющие вносить вклад в общую исследовательскую инфраструктуру.
Желательно:
- Опыт работы с архитектурами реального времени или потоковой передачи.
- Знакомство с современными архитектурами в области генерации аудио и речи (диффузионные модели, нейронные кодеки, модели потокового согласования, авторегрессионные декодеры).
- Опыт работы с системами преобразования речи в речь или текста в речь (TTS).
- Подтвержденный вклад в оригинальные исследования, например публикации или open-source работы на ведущих конференциях (ICASSP, Interspeech, NeurIPS, ICML).
🔥 ВайбLeadFull-Timevibe-coding+3