MLOps-инженер по ML-пайплайнам и LLMOps
О вакансии
AI / ML Ops Engineer. Полностью удалённая работа, доступна из любой точки мира. Тип занятости: контракт. Локация: offshore.
Ищем опытного AI/ML Ops-инженера, который соединит data science-исследования и выполнение облачной инфраструктуры. Идеальный кандидат будет создавать автоматизированные пайплайны для обучения, тестирования, развёртывания и мониторинга моделей машинного обучения и систем генеративного ИИ безопасно и в масштабе в корпоративных контейнерных средах.
Общий требуемый опыт: 4–8 лет. Релевантный опыт: 3+ года профильного опыта MLOps или DevOps по развёртыванию и управлению моделями машинного обучения в продакшене.
Обязательная сертификация: AWS Certified Machine Learning – Specialty, Google Cloud Certified Professional Machine Learning Engineer или Databricks Certified Machine Learning Professional.
Ключевые обязанности
- Проектировать и автоматизировать сквозные ML-пайплайны (Continuous Training и Continuous Deployment) с помощью оркестраторов, таких как Kubeflow, MLflow или AWS SageMaker Pipelines.
- Оркестрировать контейнерные развёртывания моделей, настраивать низколатентные инференс-эндпоинты, автоскейлинг GPU/CPU-кластеров и рантаймы обслуживания моделей на Kubernetes (KServe, Triton Inference Server).
- Внедрять надёжные основы отслеживания моделей и версионирования данных, управлять feature store (например, Feast), реестрами моделей и контролем версий для больших наборов данных с помощью DVC.
- Создавать автоматизированные шлюзы мониторинга производительности AI и данных, отслеживать деградацию точности моделей, индикаторы дрейфа данных, параметры дрейфа концептов и задержки обработки в реальном времени.
- Оптимизировать среды выполнения инференса, используя компиляторы моделей (например, ONNX, TensorRT) и стратегии квантования для сокращения времени ответа и минимизации затрат на облачные вычисления.
- Интегрировать операционные фреймворки генеративного ИИ и LLM (LLMOps), настраивать семантические кэши, параметры масштабирования векторных баз данных (например, Pinecone, Milvus) и пайплайны валидации промптов.
- Управлять контролем доступа и профилями безопасности машинного обучения, настраивать строгие барьеры разделения данных, токены доступа к моделям и протоколы шифрования для защиты чувствительных логов инференса.
Требования
- 4–8 лет опыта в разработке ПО, DevOps или data engineering, из них 3+ года — активное создание и поддержка MLOps-инфраструктур автоматизации.
- Уверенное владение Python, оркестрацией контейнеров (Docker, Kubernetes), ML-фреймворками (PyTorch, TensorFlow, Hugging Face) и продвинутым SQL.
- Глубокое понимание механики распределённых систем, ограничений управления GPU-ресурсами, паттернов развёртывания моделей (Shadow, Canary, A/B) и управления API облачных провайдеров.
- Обязательная сертификация: AWS Machine Learning Specialty, Google Cloud Professional ML Engineer или Databricks ML Professional.
Желательные квалификации
- Опыт внедрения RAG-пайплайнов (Retrieval-Augmented Generation) или дообучения open-source LLM в продакшене.
- Знакомство с инструментами infrastructure-as-code, например Terraform, для создания ML-кластеров.