Вакансии с ИИ-озвучкой
Все вакансии с ИИ-озвучкой: можно найти работу, где речь и голос собирают нейросетями, а не только микрофоном. Смотрите живые роли по инструменту и узкие пересечения с профессиями ниже.
Фильтр вакансий
Senior Research Engineer, синтез речи
Synthesia — платформа для создания видео с помощью ИИ, используемая более чем 90% компаний из списка Fortune 100. Основана в 2017 году, штаб-квартира в Лондоне, офисы и команды в Европе и США. После раунда финансирования серии E в размере 200 млн долларов оценка компании составляет 4 млрд долларов. Общий объем привлеченного финансирования превышает 530 млн долларов от инвесторов, включая Accel, NVentures (венчурное подразделение Nvidia), Kleiner Perkins, GV и Evantic Capital, а также основателей и операторов Stripe, Datadog, Miro и Webflow. В команде исследователей и инженеров (более 40 человек) в составе R&D-отдела вы будете работать над задачами в области генеративного ИИ, с фокусом на создание качественных, выразительных и работающих в реальном времени синтетических голосов. Работа связана с прикладной стороной исследовательских усилий и напрямую влияет на решения, используемые более чем 60 000 компаний по всему миру. Вы присоединитесь к команде Audio Post-Training, которая занимается генеративной речью и синтезом голоса, обеспечивая производственное качество, скорость и надежность внутренних голосовых моделей. Типичные проекты: - Разработка и оценка систем потоковой передачи и преобразования речи в речь для интерактивного синтеза голоса с низкой задержкой. - Адаптация моделей под новые входные параметры (эмоции, скорость, просодия, управление диктором и т. д.). - Внедрение методов пост-обучения (квантование, прунинг, дистилляция) для повышения эффективности и снижения задержки в генерации речи в реальном времени. - Интеграция и тестирование новых архитектур, таких как нейронные кодеки, диффузионные модели или модели потокового согласования, для повышения реалистичности и отзывчивости. - Участие в определении новых метрик оценки разговорной речи, включая системы прогнозирования MOS с учетом задержки. - Отслеживание последних исследований в области аудиодиффузии, авторегрессионных моделей, нейронных кодеков и мультимодальных LLM. - Применение DPO (Direct Preference Optimization) и дистилляции для точной настройки крупномасштабных речевых моделей. Требования: - Глубокое понимание генеративного моделирования, желательно применительно к последовательным или мультимодальным данным. - Практический опыт работы с большими языковыми моделями (LLM) или аналогичными архитектурами на основе трансформеров. - Высокий уровень владения PyTorch, включая опыт распределенного обучения и оптимизации моделей. - Хорошее понимание моделирования временных рядов и токенизации, желательно в контексте аудио или речи. - Подтвержденная способность быстро создавать прототипы, проверять гипотезы и эффективно итерировать. - Опыт сквозного обучения моделей глубокого обучения — от подготовки данных до оценки. - Сильные навыки разработки ПО, позволяющие вносить вклад в общую исследовательскую инфраструктуру. Желательно: - Опыт работы с архитектурами реального времени или потоковой передачи. - Знакомство с современными архитектурами в области генерации аудио и речи (диффузионные модели, нейронные кодеки, модели потокового согласования, авторегрессионные декодеры). - Опыт работы с системами преобразования речи в речь или текста в речь (TTS). - Подтвержденный вклад в оригинальные исследования, например публикации или open-source работы на ведущих конференциях (ICASSP, Interspeech, NeurIPS, ICML).
Фаундинг-инженер, бэкенд и платформенная разработка
Strello Health разрабатывает ИИ-голосовых ассистентов для здравоохранения. Компания находится на стадии post-seed, генерирует выручку и быстро масштабируется. Вы будете работать напрямую с основателями над созданием основной инфраструктуры для голосовых разговоров в реальном времени, включая аудиопотоки, оркестрацию LLM, API, интеграции, наблюдаемость и продакшен-системы. Требования - опыт в backend или платформенной разработке - распределённые системы - API - Linux - создание надёжных систем с нуля (0→1) - учитывается опыт co-op - рассматриваются кандидаты с разным уровнем опыта Будет плюсом - WebRTC/WebSockets - ML или LLM инфраструктура - Node.js/TypeScript - Python - Docker - Kubernetes - open-source вклад Технологический стек TypeScript/Node.js и Python.
Директор ML-инженерии, агентные системы и поиск
Обязанности - Управление технической стратегией и исполнением в продуктовой области Conversation, включая Agent Engine, инфраструктуру оценки, платформу поиска, AI-голосовую платформу (Speak) и потребительские агентные функции на базе Agent Engine. - Совместное руководство продуктовой областью в связке с продуктовым партнёром: ответственность за инженерию, планирование, приоритизацию и внешнее представительство. - Управление командой из примерно 70 инженеров, включая старших инженерных менеджеров и Staff/Principal инженеров в прямом подчинении; развитие и контроль слоя инженерных менеджеров, управляющих примерно 9 командами. - Руководство миграцией существующей агентной инфраструктуры компании на общий Agent Engine в партнёрстве с продуктовыми командами, балансируя скорость миграции и текущие дорожные карты. - Определение технической стратегии для голосовых инвестиций Spotify: решения по разработке и покупке технологий Speak, организация команды, управление голосовыми решениями для агентных продуктов. - Установление и поддержание технического стандарта оценки: разработка дисциплины создания специализированных судей и наборов данных для продуктовых решений. - Внедрение стандартов качества инженерии для эпохи AI-ассистированной разработки, включая дисциплину код-ревью и покрытие тестами. - Участие в общей группе лидеров: совместная разработка операционной модели студии, управление мощностями, приоритизация проектов, коммуникационные принципы и здоровая инженерная культура. - Представление инженерной точки зрения Conversation PA в общесистемных архитектурных обсуждениях и встречах со старшими руководителями. Требования - Глубокие технические знания, а не просто близость к технологиям: способность оценивать архитектурные предложения, вести дискуссии с ведущими инженерами, вносить технический вклад и принимать сложные компромиссные решения. - Опыт управления крупными инженерными организациями через консолидацию платформ, миграции или эволюции; подтверждённый опыт создания масштабируемой платформенной технологии. - Опыт минимум в двух областях: LLM-агентные системы и оркестрация, проектирование инфраструктуры оценки (включая автоматических судей и регрессионные наборы), крупномасштабные поисковые или retrieval-системы, ML-системы для речи и производственная голосовая инфраструктура. - Опыт управления менеджерами, а не только индивидуальными исполнителями; умение строить масштабируемую структуру управления. - Подтверждённый опыт создания сильных и гибких команд, включая реструктуризацию, перераспределение ресурсов и адаптацию к быстро меняющимся приоритетам без потери темпа. Условия - Гибкий формат работы: возможно расположение в Северной Америке или EMEA при наличии рабочего офиса. - Команда работает преимущественно в часовых поясах Восточной Северной Америки и Центральной Европы; требуется регулярное пересечение рабочих часов с командой. - Базовая зарплата в США: $281,196 – $401,709 в год, плюс опционы на акции. - Льготы: медицинская страховка, шестимесячный оплачиваемый отпуск по уходу за ребёнком, пенсионный план 401(k), ежемесячная надбавка на питание, 23 оплачиваемых дня отпуска, оплачиваемые гибкие праздники, оплачиваемый больничный.
AI/Motion-дизайнер
AI/Motion-дизайнер Ищем AI/Motion-дизайнера в performance-маркетинговую команду. Если вы умеете превращать AI-генерации в цепляющие рекламные креативы — будем рады познакомиться! Формат: полностью удалённо. Занятость: постоянная работа, график 5/2 (гибкий). Зарплата: обсуждается индивидуально. Задачи - Создание рекламных креативов (статика, видео, short-form, motion) по техническому заданию. - Генерация контента с помощью AI-инструментов: Higgsfield, Kling, Veo, Runway, Midjourney, Flux. - Сборка финальных роликов: монтаж, темп, анимация, текст, переходы, звук, AI Voice-over. - Адаптация материалов под различные площадки и форматы. Требования - Уверенное владение Premiere Pro, After Effects, DaVinci Resolve или CapCut. - Владение Photoshop или аналогичным редактором для работы со статикой. - Практический опыт работы с современными AI-инструментами для генерации видео и изображений. - Наличие портфолио с готовыми работами. - Уровень: Strong Junior и выше. Условия - Полностью удалённый формат работы. - Русскоязычная команда. - Оплачиваемые подписки на необходимые AI-сервисы. - Долгосрочное сотрудничество. - Конкурентная зарплата по результатам собеседования.