О команде
Мы создаём инфраструктуру для обучения и дообучения больших языковых (LLM) и визуально-языковых (VLM) моделей. Наша задача — сделать систему максимально эффективной: рационально использовать вычислительные ресурсы и снижать риски сбоев. Всё более востребованным становится обучение с подкреплением (Reinforcement Learning, RL) — появляется необходимость создания специализированной инфраструктуры.
Задачи
- Оптимизация инфраструктуры RL-обучения: оптимизация доставки и сохранения данных, коммуникаций между блоками обучения; повышение эффективности работы внутри блоков.
- Развитие инструментов диагностики: создавать и улучшать инструменты, чтобы быстро находить и решать инфраструктурные проблемы.
- Обеспечение отказоустойчивости инфраструктуры: реализовывать подходы, которые сделают инфраструктуру обучения устойчивой к ошибкам и сбоям.
- Исследование решений: изучать новейшие подходы к организации инфраструктуры RL-обучения, оценивать их эффективность, внедрять в реальные проекты.
Требования
- Знание Python и опыт в системном программировании, разработке библиотек или фреймворков.
- Умение работать с PyTorch и распределённым обучением через torch.distributed.
- Владение подходами параллелизации.
- Интерес к LLM и MLOps.
- Умение эффективно работать в команде.
Будет плюсом
- Участие в создании инфраструктуры обучения ML-моделей.
- Внедрение и оптимизация RL-решений.
- Использование библиотек RL-обучения для LLM и библиотек инференса.
- Опыт работы с GPU NVIDIA: понимание архитектуры GPU, разработка или оптимизация алгоритмов с использованием CUDA или Triton.
- Владение C++, опыт низкоуровневого программирования и оптимизации.
Условия
- В крупных офисах есть спортзалы с тренажёрами, инвентарём и душевыми.