Назад к вакансиям
remotevibecodingjobs20 августа 2026 г.

Senior Research Engineer, синтез речи

Synthesia

ВознаграждениеПо договорённости
Локация
Europe, UK
Формат
Офис
Направления
Вайбкодинг, ML-инженер, Дизайнер, Создание ИИ-аватаров
Отклик
На remotevibecodingjobs

Synthesia — платформа для создания видео с помощью ИИ, используемая более чем 90% компаний из списка Fortune 100. Основана в 2017 году, штаб-квартира в Лондоне, офисы и команды в Европе и США. После раунда финансирования серии E в размере 200 млн долларов оценка компании составляет 4 млрд долларов. Общий объем привлеченного финансирования превышает 530 млн долларов от инвесторов, включая Accel, NVentures (венчурное подразделение Nvidia), Kleiner Perkins, GV и Evantic Capital, а также основателей и операторов Stripe, Datadog, Miro и Webflow.

В команде исследователей и инженеров (более 40 человек) в составе R&D-отдела вы будете работать над задачами в области генеративного ИИ, с фокусом на создание качественных, выразительных и работающих в реальном времени синтетических голосов. Работа связана с прикладной стороной исследовательских усилий и напрямую влияет на решения, используемые более чем 60 000 компаний по всему миру. Вы присоединитесь к команде Audio Post-Training, которая занимается генеративной речью и синтезом голоса, обеспечивая производственное качество, скорость и надежность внутренних голосовых моделей.

Типичные проекты:

  • Разработка и оценка систем потоковой передачи и преобразования речи в речь для интерактивного синтеза голоса с низкой задержкой.
  • Адаптация моделей под новые входные параметры (эмоции, скорость, просодия, управление диктором и т. д.).
  • Внедрение методов пост-обучения (квантование, прунинг, дистилляция) для повышения эффективности и снижения задержки в генерации речи в реальном времени.
  • Интеграция и тестирование новых архитектур, таких как нейронные кодеки, диффузионные модели или модели потокового согласования, для повышения реалистичности и отзывчивости.
  • Участие в определении новых метрик оценки разговорной речи, включая системы прогнозирования MOS с учетом задержки.
  • Отслеживание последних исследований в области аудиодиффузии, авторегрессионных моделей, нейронных кодеков и мультимодальных LLM.
  • Применение DPO (Direct Preference Optimization) и дистилляции для точной настройки крупномасштабных речевых моделей.

Требования:

  • Глубокое понимание генеративного моделирования, желательно применительно к последовательным или мультимодальным данным.
  • Практический опыт работы с большими языковыми моделями (LLM) или аналогичными архитектурами на основе трансформеров.
  • Высокий уровень владения PyTorch, включая опыт распределенного обучения и оптимизации моделей.
  • Хорошее понимание моделирования временных рядов и токенизации, желательно в контексте аудио или речи.
  • Подтвержденная способность быстро создавать прототипы, проверять гипотезы и эффективно итерировать.
  • Опыт сквозного обучения моделей глубокого обучения — от подготовки данных до оценки.
  • Сильные навыки разработки ПО, позволяющие вносить вклад в общую исследовательскую инфраструктуру.

Желательно:

  • Опыт работы с архитектурами реального времени или потоковой передачи.
  • Знакомство с современными архитектурами в области генерации аудио и речи (диффузионные модели, нейронные кодеки, модели потокового согласования, авторегрессионные декодеры).
  • Опыт работы с системами преобразования речи в речь или текста в речь (TTS).
  • Подтвержденный вклад в оригинальные исследования, например публикации или open-source работы на ведущих конференциях (ICASSP, Interspeech, NeurIPS, ICML).