LLM DevOps/Inference Engineer
Локация: удаленно
Контекст: работа над платформой оценки и бенчмаркинга ИИ-моделей для здравоохранения. Начальная цель — клинические задачи прогнозирования: сепсис, дни до смерти, прогнозирование трендов лабораторных показателей. Оценка проводится на нескольких frontier-моделях и отраслевых моделях.
Обязанности:
- Построение и поддержка AWS-инфраструктуры платформы оценки как кода: сеть, вычисления, оркестрация, секреты, наблюдаемость, CI/CD.
- Запуск self-hosted трека инференса для нишевых медицинских моделей: GPU-инфраструктура с батчингом, квантизацией, автоскейлингом и стандартным онбордингом новых моделей.
- Создание слоя абстракции провайдеров совместно с ИИ-инженерами: единый интерфейс для API-моделей (OpenAI, Anthropic, Gemini и др.) и self-hosted моделей. Ответственность за rate limiting, ретраи, управление квотами, логирование запросов и ответов, атрибуцию затрат на запуск.
- Обеспечение воспроизводимости и оптимизации затрат на бенчмарк-запуски: закрепление версий моделей и контейнеров, стратегия spot и reserved capacity, устранение простоя GPU.
- Построение наблюдаемости: пропускная способность, задержка, стоимость токенов и GPU-часов, таксономия сбоев, дашборды по моделям.
- Поддержка волновой нагрузки: возможность для группы ИИ-инженеров запускать эксперименты и уходить без поломок и осиротевших ресурсов.
- Участие в архитектуре Trusted Execution Environment (TEE): оценка AWS Nitro Enclaves и аналогичных подходов для сценария bring-your-own-data / bring-your-own-model, включая аттестационный выпуск ключей и практические ограничения инференса внутри enclave.
Требования:
- AWS-инфраструктура на продакшн-масштабе: EKS или ECS, GPU-инстансы EC2 (G5/G6, P4d/P5) и их ограничения, проектирование VPC, IAM, KMS, Secrets Manager, ECR, CloudWatch, Service Quotas.
- Инфраструктура как код: Terraform. Без ручного создания ресурсов через консоль.
- Опыт работы с LLM: практическое владение стратегией батчинга, поведением KV cache, компромиссами квантизации, мульти-GPU шардированием.
- Оркестрация контейнеров и планирование GPU: ECS/EKS с GPU-нагрузками, автоскейлинг нод, пайплайны сборки образов для CUDA-зависимых стеков.
- Надежность и оптимизация затрат: SLO, алертинг, подтвержденный опыт снижения облачных расходов без потери функциональности.
- Опыт запуска инференс-контейнеров.
- Опыт в ИИ и LLM.
- Опыт работы в здравоохранении (HIPAA, HL7 и др.).
- Сильные коммуникативные навыки.
Желательно:
- Опыт с AWS SageMaker endpoints и Bedrock.
- Практический опыт Python для работы с harness и слоем адаптеров провайдеров.
- Основы конфиденциальных вычислений: enclaves, remote attestation, sealed key release, границы безопасности TEE.
- Комплаенс в здравоохранении: выбор HIPAA-совместимых сервисов, BAA scope, аудит-логирование, контроль доступа к PHI.
- Усиление безопасности: сканирование образов, контроль исходящего сетевого трафика для замкнутого контура.
Будет плюсом:
- Опыт хостинга медицинских изображений или мультимодальных моделей.
- Nitro Enclaves в продакшене или аналогичный опыт TEE.
- Опыт поддержки self-service сред, чистых границ тенантов и быстрого предоставления учетных данных.