Назад к вакансиям
Дата обнаружения: 22 сентября 2026 г.

NLP-разработчик в команду качества претрейна Alice LLM

Яндекс

ЗарплатаПо договорённости
Страна
Не указана
Город
Не указан
Формат
Офис
Направления
ML-инженер
Где отклик
Сайт вакансий

О проекте

Ищем ML-разработчика, который будет улучшать качество претрейна Alice AI LLM. Это направление, отвечающее за умность базовой модели и качество данных.

Гонка LLM ускоряется: модели решают задачи в математике, коде, агентах, медицине, которые ещё недавно требовали участия человека. При этом крупные улучшения LLM происходят при обновлении и масштабировании претрейна: именно на этом этапе закладываются базовые способности модели, от которых зависит качество на всех последующих срезах.

Мы считаем, что побеждает в этой гонке тот, кто эффективнее и быстрее улучшает претрейны, и вкладываемся в это направление: исследуем способы улучшения качества моделей, ставим тяжёлые вычислительные эксперименты, обрабатываем и синтезируем данные огромного масштаба.

Результат нашей работы — это модели семейства Alice AI, которые доступны в одноименном сервисе. Делая нашу модель умнее, вы улучшите главного и самого массового AI-ассистента в России, которым уже пользуется более 24 млн человек еженедельно.

Задачи

  • Эксперименты с претрейн-моделями: ставить и анализировать вычислительно тяжёлые эксперименты с претрейн-стадией, проверять гипотезы об источниках прироста ризонинг-способностей внутри различных срезов умности.
  • Пайплайны данных: строить эффективные пайплайны сбора обучающих данных, их синтеза, обработки и фильтрации в новых доменах, масштабировать и делать более эффективными.
  • Изменение процесса обучения: модифицировать процесс обучения модели для задач улучшения ризонинга, внедрять изменения в обучающий пайплайн и оценивать их влияние на качество.
  • Экспертные модели: обучать модели-верификаторы для проверки качества данных и ответов, модели для генерации обучающих данных, которые являются SOTA в своём узком домене, модели-фильтры для отсева некачественных данных.
  • Исследование скейлинга: исследовать законы скейлинга качества модели с точки зрения данных и вычислений, определять, как масштабирование влияет на рост рассуждающих способностей в разных доменах.

Требования

  • Глубоко разбираетесь в NLP.
  • Знаете Python и разрабатывали на нём.

Будет плюсом

  • Обучали претрейн-модели в любой из модальностей (NLP, CV, звук, рекомендации).
  • Строили эффективные CPU/GPU-пайплайны.
  • Погружены хотя бы в одну из областей исследования языковых моделей (RL, архитектуры или данные для LLM).