Мы управляем одним из самых дефицитных и самых дорогих ресурсов компании — графическими процессорами (GPU). Их эффективное использование критически важно для работы ключевых сервисов Яндекса. Наша миссия — обеспечить максимальную отдачу и эффект от каждой GPU-карты.
Задачи
- Повышение эффективности утилизации GPU: формировать гипотезы и исследовать способы повышения эффективности утилизации GPU, участвовать в реализации и внедрении наиболее профитных решений. Формировать рекомендации и лучшие практики по повышению производительности.
- Оптимизация и профилирование: находить узкие места в производительности и устранять их с помощью профилировщиков, оптимизировать доступ к памяти, время ожидания и пропускную способность.
- Развитие инструментов диагностики: создавать и улучшать инструменты для быстрого выявления и устранения инфраструктурных проблем, которые влияют на эффективность утилизации, стабильность и скорость GPU-вычислений.
- Исследование и внедрение современных решений: изучать новейшие подходы к организации инфраструктуры для обучения и инференса, оценивать их эффективность и внедрять в проекты.
- Анализ архитектуры, тестирование, интеграция: взаимодействовать с разработчиками, ML-инженерами и системными архитекторами. Участвовать в оценке аппаратных решений и предлагать улучшения для будущих поколений GPU.
Требования
- Знание Python и опыт системного программирования
- Опыт работы с фреймворком PyTorch
- Опыт оптимизации производительности GPU-приложений и повышения эффективности утилизации GPU
- Опыт работы с GPU (NVIDIA) и CUDA
- Применение подходов параллелизации для распределённого инференса или обучения
Будет плюсом
- Уверенное владение C/C++ или аналогичными низкоуровневыми языками
- Опыт работы с библиотеками RL-обучения для LLM
Бонусы
Яндекс — это комьюнити. Тут есть и спортивные клубы, и книжный клуб, и киберспортивное сообщество. Это не все бонусы — полный список тут.
