Вакансия удаленная, открыта для кандидатов из США. Компания — глобальный лидер в области кибербезопасности, специализирующийся на предотвращении взломов с помощью продвинутых платформ на базе ИИ. Ищут Senior AI Infrastructure Engineer для проектирования, создания и масштабирования ИИ-инфраструктуры для продуктов, с фокусом на большие языковые модели (LLM) и ИИ-системы.
Обязанности
- Предоставление и настройка крупных GPU-кластеров и вычислительных ресурсов для задач обучения, дообучения и инференса LLM.
- Оптимизация инфраструктуры обслуживания LLM-моделей, включая развертывание и оптимизацию различных фреймворков инференса.
- Управление жизненным циклом моделей: версионирование, контрольные точки и воспроизводимость в процессах обучения и инференса.
- Проектирование и внедрение надежных фреймворков оценки для проверки производительности, точности и надежности моделей, обеспечивая соответствие ИИ-систем производственным стандартам.
- Выявление и устранение узких мест использования GPU и эффективности памяти GPU, применение таких техник, как квантование, пакетная обработка и кэширование.
- Проектирование и поддержка платформ и пайплайнов данных, специально предназначенных для поддержки LLM, RAG (Retrieval-Augmented Generation) и ИИ-систем в производственной среде, с акцентом на производительность, сопровождаемость и строгость тестирования, обеспечивая быструю поставку без ущерба качеству.
- Применение экспертизы в моделировании данных, нормализации и семантическом каталогизировании для AI/ML-нагрузок.
- Определение и внедрение лучших практик MLOps/DataOps для LLM, включая мониторинг, наблюдаемость и механизмы восстановления для ИИ-сервисов.
- Тщательное документирование архитектурных решений и донесение технических деталей до заинтересованных сторон.
- Взаимодействие с Data Scientists, Product Managers и другими инженерными командами для превращения исследовательских прототипов в надежные сервисы производственного уровня.
Требования
- Степень бакалавра в области компьютерных наук, инженерии данных или STEM; магистерская степень приветствуется.
- 6+ лет опыта в инфраструктурной/дата-инженерии, как минимум 2 года в создании и поддержке платформ/пайплайнов, поддерживающих LLM-системы и приложения.
- Подтвержденный практический опыт в LLM-инфраструктуре: предоставление кластеров, оптимизация обучающих нагрузок и поддержка инференс-пайплайнов.
- Исключительная способность писать чистый, элегантный, поддерживаемый и хорошо протестированный код, а также сильный фокус на быстрой поставке результатов.
- Глубокое понимание инженерных практик, включая эффективные ревью кода и отказоустойчивую архитектуру.
- Проявление технического лидерства и наставнических качеств.
- Подтвержденный опыт использования ИИ-технологий для улучшения принятия решений, оптимизации рабочих процессов и процессов, повышения эффективности и бизнес-результатов.
- Практический опыт с MLOps-инструментами (MLflow, SageMaker, AI).
- Сильное понимание основ CUDA, драйверов, GPU и TPU.
- Опыт работы с фреймворками инференса, такими как vLLM и Triton Inference Server.
- Владение фреймворками обучения: PyTorch, Ray, Megatron, JAX.
- Экспертный уровень владения высокоуровневым языком программирования (Python).
- Глубокие знания контейнеризации и оркестрации (Slurm, Airflow).
- Владение инструментами Infrastructure as Code, такими как Terraform и Ansible.
- Опыт работы с облачными платформами (AWS, GCP или OCI) и сервисами данных.
- Опыт работы в сфере кибербезопасности, разведки или отраслях с высокими требованиями к соответствию.
- Опыт создания, развертывания и управления LLM в производственной среде.
- Опыт работы с распространенными фреймворками рабочих процессов.
- Опыт работы с фреймворками обработки данных (например, Dask, Flink).
Условия
- Право на бонусы.
- Гранты на акции.
- Комплексный пакет льгот: медицинская страховка, 401k, оплачиваемый отпуск, конкурентоспособная компенсация и акции.
- Комплексные программы физического и психического здоровья.
- Конкурентоспособный отпуск и праздники, отпуск по уходу за ребенком и усыновлению.
- Возможности для развития для всех сотрудников независимо от уровня или роли.
- Сети сотрудников, географические сообщества и волонтерские возможности для установления связей.
- Офисная культура с удобствами мирового класса.
- Сертификация Great to Work Certified™ по всему миру.