Команда ML Workflows Engineering занимается устранением инфраструктурных сложностей, оптимизацией операций машинного обучения (MLOps) и позволяет командам сосредоточиться на главном — создании значимых ML-моделей и интеллектуальных агентов. В составе команды вы будете играть ключевую роль в проектировании инструментов, автоматизации и пайплайнов, которые делают разработку машинного обучения простой и интуитивной. Интегрируя передовые практики MLOps и инженерное мастерство, мы стремимся максимизировать продуктивность и устранить сложность ML-инфраструктуры, чтобы наши команды могли расширять границы возможного в ИИ.
Задачи
- Создавать инструменты, автоматизацию и рабочие процессы для упрощения задач, связанных с инфраструктурой, позволяя ИИ-командам сосредоточиться на экспериментах и решении ключевых задач.
- Разрабатывать надежные системы мониторинга, логирования и трассировки для обеспечения производительности и воспроизводимости ML-процессов в продакшене.
- Проектировать, внедрять и поддерживать сквозные пайплайны машинного обучения для бесшовной разработки, обучения и развертывания ML-моделей и интеллектуальных агентов.
- Работать с крупномасштабными распределенными системами, включая GPU-кластеры, для поддержки обучения, дообучения и оценки ML-моделей.
- Взаимодействовать с продуктовыми и разработческими командами для превращения целей высокого уровня в конкретные, масштабируемые и поддерживаемые системы.
- Оптимизировать рабочие процессы для воспроизводимости, масштабируемости и экономической эффективности, сохраняя продуктивность ML-команд и их фокус на инновациях.
Требования
- Практический опыт работы с современными MLOps-инструментами, включая Kubernetes, облачных провайдеров (GCP и AWS) и фреймворки оркестрации ML.
- Глубокое понимание жизненного цикла ML от идеи до пользовательского приложения.
- Способность вести проекты от начала до конца, начиная с проблемы высокого уровня или болевой точки продукта и контролируя этапы проектирования, экспериментов, внедрения и итераций.
- Клиентоориентированное мышление — вам важно, как реально работают ML-инженеры, и вы можете превращать их потребности в практические, масштабируемые и поддерживаемые архитектурные решения.
- Опыт работы с современными CI/CD-системами, такими как GitHub Actions или JetBrains TeamCity.
- Не менее трех лет опыта написания чистого, поддерживаемого кода на Python в современных ML-кодовых базах.
Желательно
- Опыт работы с ML-оркестраторами и инструментами рабочих процессов, такими как ZenML, Dagster и Airflow.
- Разработка инфраструктурных компонентов и сервисов с использованием кластерных решений, таких как Kubernetes.
- Разработка бэкенд-сервисов на Python.
- Создание и поддержка ML-пайплайнов, включая унаследованные.
- Отслеживание экспериментов и наблюдаемость с помощью таких инструментов, как Weights & Biases, MLflow, Langfuse или аналогичных.
Будет плюсом
- Опыт работы с фреймворками инференса LLM, такими как vLLM, DeepSpeed и TensorRT.
- Написание и поддержка Python-библиотек, используемых внутренними (или внешними) ML-инженерами.
- Сильная теоретическая база в NLP и подходах на основе трансформеров.
- Написание кода на Java и/или Kotlin.
Условия
- Гибридный формат работы.