Занятость: full-time. Локация: Астана / Алматы. Формат: гибрид. Старт: середина сентября 2026. Проект: до конца 2026 года с возможным продлением. Ставка: обсуждается. Требуемая релевантность опыта: 85%+. Дедлайн подачи резюме: 29.08.2026.
Задачи:
- развёртывание ML-моделей в production;
- контейнеризация и настройка inference-серверов;
- работа с Triton, TorchServe, BentoML или аналогами;
- администрирование GPU-серверов;
- NVIDIA Drivers, CUDA, cuDNN;
- настройка GPU-нод в Kubernetes;
- CI/CD для ML-сервисов;
- мониторинг и алертинг через Prometheus/Grafana;
- управление ресурсами GPU-кластера и оптимизация их загрузки.
Требования:
- Docker, Kubernetes, Helm;
- MLflow;
- Triton / BentoML / TorchServe;
- Python + Bash/Shell;
- NVIDIA GPU, CUDA, cuDNN;
- nvidia-smi, DCGM;
- GitHub Actions / GitLab CI / Argo Workflows;
- Prometheus, Grafana.
Проект: развёртывание и администрирование ML-моделей в production-среде телеком-оператора.