Компания Legion ищет директора по производственной инженерии (DevOps/SRE). Позиция удалённая, США.
О позиции: Кандидат будет отвечать за надёжность, автоматизацию и безопасность производственной среды. Инфраструктура работает на AWS с использованием EKS, RDS и других нативных сервисов. Роль предполагает сочетание стратегического руководства и практической работы: около 20–30% времени — непосредственный вклад в архитектуру, инструменты и реагирование на инциденты, остальное — видение, дорожная карта и координация команд.
Обязанности:
- Нанимать и развивать глобально распределённую команду DevOps/SRE: подбор, менторство, управление инженерами, формирование культуры ответственности и непрерывного улучшения.
- Отвечать за дорожную карту надёжности и инфраструктуры для AWS-среды, включая EKS, RDS и связанные сервисы, обеспечивая масштабируемость, высокую доступность и экономическую эффективность.
- Руководить практикой SecOps: управление уязвимостями, обнаружение угроз, реагирование на инциденты и устранение последствий.
- Определять и продвигать OKR для инфраструктуры, автоматизации и безопасности, отслеживать прогресс по измеримым результатам.
- Внедрять лучшие практики наблюдаемости и алертинга (например, Datadog), включая автоматизацию триажа и реагирования для сокращения времени восстановления.
- Понимать инфраструктуру агентного ИИ и применение агентных ИИ-процессов в SDLC и DevOps (автоматизированное расследование, исправление, генерация PR).
- Развивать практики Infrastructure-as-Code, CI/CD и автоматизации для повышения скорости разработки и снижения рутинных операций.
- Согласовывать с командами инженерии и IT стандарты инфраструктуры, контроль доступа, инструменты и требования соответствия.
- Обеспечивать соответствие платформы высоким стандартам безопасности, соответствия и защиты данных; поддерживать контроль безопасности и готовность к аудиту.
- Участвовать в ротации дежурств по управлению инцидентами совместно с SRE и командами разработки для достижения целей доступности.
- Отслеживать актуальные практики в облаке, DevOps и безопасности, давать технические рекомендации и развивать инженерную организацию.
Требования:
- 8–12 лет опыта в DevOps, SRE или производственной инфраструктуре, включая управление людьми.
- Глубокий практический опыт эксплуатации production-нагрузок на AWS: EKS (Kubernetes), RDS, а также VPC, IAM, Lambda, S3.
- Подтверждённый опыт в SecOps: управление уязвимостями, реагирование на инциденты, устранение проблем безопасности в production.
- 5+ лет работы с платформами наблюдаемости (Datadog, Prometheus, Grafana) для повышения надёжности, производительности и качества алертинга.
- Сильный опыт с Infrastructure-as-Code (Terraform, CloudFormation) и автоматизацией CI/CD.
- Владение хотя бы одним из языков: Go, Python или Bash; ежедневное использование Git и пайплайнов тестирования.
- Практический опыт эксплуатации Linux/Unix production-платформ (Amazon Linux, Ubuntu, RHEL/CentOS).
- Подтверждённый опыт кросс-функционального взаимодействия с инженерией и IT по инфраструктуре, инструментам и стандартам безопасности.
- Опыт управления инцидентами и on-call практиками для высоконагруженных систем.
- Степень бакалавра в Computer Science, инженерии или смежной области обязательна; магистерская степень приветствуется.
Предпочтительные требования:
- Опыт с другими облачными провайдерами: Google Cloud Platform или Oracle Cloud Infrastructure (OCI).
- Профильные сертификаты по безопасности: CISSP, AWS Security Specialty, CKS.
- Опыт с фреймворками соответствия: SOC 2, ISO 27001, HIPAA.
- 3+ года работы с Kubernetes или другими системами оркестрации контейнеров в масштабе.
- Опыт с Kubernetes-нативными инструментами доставки: Argo Workflows, Helm.
- 5+ лет руководства командами в agile/scrum среде.
- Опыт создания или масштабирования автоматизированных пайплайнов расследования и исправления ошибок в production.
Условия:
- Зарплата: $220 000 – $265 000 в год + бонус + акции компании.