Компания: Grafana Labs.
Формат: удалённая работа. Рассматриваются кандидаты из Великобритании, Швеции, Испании, Германии или Ирландии.
Роль: Staff Software Engineer — SRE для облачных баз данных Grafana Cloud (Mimir, Loki, Tempo, Pyroscope). Базы данных предоставляются как SaaS на AWS, GCP и Azure во всех регионах. SRE-команда встроена в продуктовые группы Mimir, Loki и Tempo.
Задачи
- Тесное партнёрство с продуктовыми инженерными командами (встроенная модель).
- Обеспечение надёжности production-среды для клиентов с высокими SLA и сложных окружений.
- Проектирование и внедрение автоматизации для масштабирования практик надёжности.
- Обеспечение достижения клиентами целевых показателей SLO.
- Определение и развитие пер-тенантных SLO и моделей надёжности.
- Проактивное снижение выгорания SLO для предотвращения повторных инцидентов.
- Выполнение роли основного эскалационного контакта и дежурного (on-call) при инцидентах.
- Руководство разбором инцидентов, влияющих на клиентов, и пост-инцидентными ревью.
- Участие в проектировании (design docs) и код-ревью.
- Влияние на дизайн функций для обеспечения масштабируемости и эксплуатационной пригодности.
- Создание автоматизации для устранения рутинной работы (toil).
- Улучшение качества алертов и снижение шумных эскалаций.
Требования
- 8+ лет инженерного опыта, из них 4+ в SRE/CRE/production engineering. Предпочтителен формальный опыт в customer reliability engineering.
- Сильный опыт работы с Kubernetes на AWS, GCP или Azure, знакомство с инструментами infrastructure-as-code (Helm, Terraform, Jsonnet и т.п.).
- Сильный опыт технического лидерства: ведение команды через проекты, наставничество инженеров, роль force-multiplier.
- Опыт эксплуатации мульти-тенантных систем в production.
- Сильный опыт проектирования и внедрения SLO.
- Опыт с одним или несколькими языками программирования (например, Go, Python, Java).
- Опыт с внутренностями ОС Linux, знание сетей, облачного хранения и масштабирования.
- Отличные навыки решения проблем и диагностики.
- Опыт спокойного и активного участия в blame-free инцидент-менеджменте, выполнения последующих действий и написания качественных PIR (Post Incident Reviews).
- Умение рассуждать о производительности, масштабировании и режимах отказов.
- Комфортная работа в инженерной команде с высокой степенью автономии и самонаправленности.
- Способность к глубокому партнёрству с продуктовыми командами.
- Ценятся интеллектуальное любопытство, прозрачность, склонность к действию и доброта.
Условия
- Удалённая работа (из указанных стран).
- Компания предоставляет бюджет на использование современных AI-ассистентов для кодирования (в рамках политики безопасности), а также доступ к передовым моделям (например, GPT-Codex 5/3, Claude Opus 4.6, Gemini 3 Pro).