Назад к вакансиям
remotevibecodingjobs9 августа 2026 г.

DevOps-инженер LLM-инференса

Zuplon

ВознаграждениеПо договорённости
Локация
Anywhere
Формат
Удаленка
Направления
Вайбкодинг, ML-инженер, DevOps, Дизайнер
Отклик
На remotevibecodingjobs

LLM DevOps/Inference Engineer

Локация: удаленно

Контекст: работа над платформой оценки и бенчмаркинга ИИ-моделей для здравоохранения. Начальная цель — клинические задачи прогнозирования: сепсис, дни до смерти, прогнозирование трендов лабораторных показателей. Оценка проводится на нескольких frontier-моделях и отраслевых моделях.

Обязанности:

  • Построение и поддержка AWS-инфраструктуры платформы оценки как кода: сеть, вычисления, оркестрация, секреты, наблюдаемость, CI/CD.
  • Запуск self-hosted трека инференса для нишевых медицинских моделей: GPU-инфраструктура с батчингом, квантизацией, автоскейлингом и стандартным онбордингом новых моделей.
  • Создание слоя абстракции провайдеров совместно с ИИ-инженерами: единый интерфейс для API-моделей (OpenAI, Anthropic, Gemini и др.) и self-hosted моделей. Ответственность за rate limiting, ретраи, управление квотами, логирование запросов и ответов, атрибуцию затрат на запуск.
  • Обеспечение воспроизводимости и оптимизации затрат на бенчмарк-запуски: закрепление версий моделей и контейнеров, стратегия spot и reserved capacity, устранение простоя GPU.
  • Построение наблюдаемости: пропускная способность, задержка, стоимость токенов и GPU-часов, таксономия сбоев, дашборды по моделям.
  • Поддержка волновой нагрузки: возможность для группы ИИ-инженеров запускать эксперименты и уходить без поломок и осиротевших ресурсов.
  • Участие в архитектуре Trusted Execution Environment (TEE): оценка AWS Nitro Enclaves и аналогичных подходов для сценария bring-your-own-data / bring-your-own-model, включая аттестационный выпуск ключей и практические ограничения инференса внутри enclave.

Требования:

  • AWS-инфраструктура на продакшн-масштабе: EKS или ECS, GPU-инстансы EC2 (G5/G6, P4d/P5) и их ограничения, проектирование VPC, IAM, KMS, Secrets Manager, ECR, CloudWatch, Service Quotas.
  • Инфраструктура как код: Terraform. Без ручного создания ресурсов через консоль.
  • Опыт работы с LLM: практическое владение стратегией батчинга, поведением KV cache, компромиссами квантизации, мульти-GPU шардированием.
  • Оркестрация контейнеров и планирование GPU: ECS/EKS с GPU-нагрузками, автоскейлинг нод, пайплайны сборки образов для CUDA-зависимых стеков.
  • Надежность и оптимизация затрат: SLO, алертинг, подтвержденный опыт снижения облачных расходов без потери функциональности.
  • Опыт запуска инференс-контейнеров.
  • Опыт в ИИ и LLM.
  • Опыт работы в здравоохранении (HIPAA, HL7 и др.).
  • Сильные коммуникативные навыки.

Желательно:

  • Опыт с AWS SageMaker endpoints и Bedrock.
  • Практический опыт Python для работы с harness и слоем адаптеров провайдеров.
  • Основы конфиденциальных вычислений: enclaves, remote attestation, sealed key release, границы безопасности TEE.
  • Комплаенс в здравоохранении: выбор HIPAA-совместимых сервисов, BAA scope, аудит-логирование, контроль доступа к PHI.
  • Усиление безопасности: сканирование образов, контроль исходящего сетевого трафика для замкнутого контура.

Будет плюсом:

  • Опыт хостинга медицинских изображений или мультимодальных моделей.
  • Nitro Enclaves в продакшене или аналогичный опыт TEE.
  • Опыт поддержки self-service сред, чистых границ тенантов и быстрого предоставления учетных данных.