Назад к вакансиям
Дата обнаружения: 4 сентября 2026 г.

Team Lead в команду ML-инфраструктуры R&D

ЗарплатаПо договорённости
Страна
Не указана
Город
Не указан
Формат
Офис
Грейд
Lead
Направления
ML-инженер
Где отклик
Телеграм

О команде

Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Наша задача — сделать систему максимально эффективной: рационально использовать вычислительные ресурсы и снижать риски сбоев. Всё более востребованным становится обучение с подкреплением (Reinforcement Learning, RL) — появляется необходимость создания специализированной инфраструктуры.

Задачи

  • Оптимизация инфраструктуры RL-обучения: оптимизация доставки и сохранения данных, коммуникаций между блоками обучения; повышение эффективности работы внутри блоков.
  • Развитие инструментов диагностики: создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы.
  • Обеспечение отказоустойчивости инфраструктуры: реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к ошибкам и сбоям.
  • Исследование решений: изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность, внедрять в реальные проекты.

Требования

  • Знание Python и опыт в системном программировании, разработке библиотек или фреймворков.
  • Умение работать с PyTorch и распределённым обучением через torch.distributed.
  • Владение подходами параллелизации.
  • Интерес к LLM и MLOps.
  • Умение эффективно работать в команде.

Будет плюсом

  • Участие в создании инфраструктуры обучения ML-моделей.
  • Внедрение и оптимизация RL-решений.
  • Использование библиотек RL-обучения для LLM и библиотек инференса.
  • Опыт работы с GPU NVIDIA: понимание архитектуры GPU, разработка или оптимизация алгоритмов с использованием CUDA или Triton.
  • Владение C++, опыт низкоуровневого программирования и оптимизации.

Условия

  • В крупных офисах есть спортзалы с тренажёрами, инвентарём и душевыми.