LLMOps
Компания
KODE
Локация
Калининград
Формат работы
Удалённая работа, гибрид, офис
Занятость
Полная
Зарплата
от 170 000 до 230 000 gross
Особенности найма
- 2 этапа интервью
Задачи
- Развертывание, сопровождение и обновление LLM-инференс платформ (vLLM, SGLang, Ollama)
- Эксплуатация и развитие AI-платформы в Kubernetes, включая масштабирование и управление GPU-ресурсами
- Настройка AI Gateway (LiteLLM): маршрутизация запросов, API-ключи, квоты, лимиты и политики доступа
- Оптимизация производительности inference: batching, KV Cache, semantic cache, снижение latency и стоимости инференса
- Настройка мониторинга, логирования и трассировки (OpenTelemetry, Langfuse, Signoz, Prometheus/Grafana)
- Автоматизация CI/CD процессов для инфраструктуры и моделей, поддержка GitOps-подхода
- Интеграция и сопровождение сервисов памяти, векторных хранилищ и компонентов RAG/Agentic AI
- Диагностика и устранение инцидентов, обеспечение стабильности и высокой доступности LLM-платформы
Требования
- Опыт в роли DevOps от 3 лет
- Опыт администрирования Kubernetes в production, Docker, Helm, понимание GitOps-подходов
- Опыт эксплуатации LLM inference-серверов (vLLM, SGLang, Ollama или TGI) и понимание их архитектуры
- Хорошее понимание принципов работы LLM: токены, KV Cache, batching, streaming, квантование, RAG
- Практический опыт работы с GPU (NVIDIA/CUDA), распределением ресурсов и оптимизацией производительности
- Опыт настройки мониторинга и observability (Prometheus, Grafana, OpenTelemetry, Signoz/Langfuse)
- Уверенные знания Linux, Docker, сетевого взаимодействия и диагностики инфраструктурных проблем
- Навыки автоматизации на Python и работы с CI/CD (GitLab CI/GitHub Actions)
- Опыт работы с Redis, PostgreSQL и API-шлюзами
Будет плюсом
- Знание LiteLLM, KEDA, Qdrant/Milvus
