О роли
Grafana Labs — компания, развивающая Grafana Cloud, управляемую платформу наблюдаемости с открытым исходным кодом. Компания полностью удалённая, сотрудники работают в более чем 40 странах.
Ищем Staff Software Engineer — SRE для повышения надёжности облачных баз данных Grafana Cloud, основанных на Mimir, Loki, Tempo и Pyroscope. Базы данных предоставляются как SaaS-продукт на AWS, GCP и Azure во всех регионах. SRE-команда встроена в продуктовые команды Mimir, Loki и Tempo и отвечает за надёжность продуктов для клиентов с высокими SLA.
Задачи
- Работа в партнёрстве с продуктовыми инженерными командами (встроенная модель).
- Обеспечение производственной надёжности для сред с высокими SLA и сложных клиентских окружений.
- Проектирование и внедрение автоматизации для масштабирования практик надёжности.
- Обеспечение достижения клиентами целей SLO.
- Определение и развитие SLO и моделей надёжности для отдельных тенантов.
- Проактивное снижение выгорания SLO для предотвращения повторных инцидентов.
- Выполнение роли основного эскалационного контакта и дежурного по инцидентам.
- Руководство реагированием на инциденты, влияющие на клиентов, и проведение пост-инцидентных разборов.
- Участие в проектировании и ревью кода.
- Влияние на дизайн функций для обеспечения масштабируемости и эксплуатационной готовности.
- Создание автоматизации для устранения рутинной работы.
- Улучшение качества алертов и снижение шумных эскалаций.
Требования
- 8+ лет инженерного опыта, из них 4+ в SRE/CRE/production engineering. Предпочтителен формальный опыт в customer reliability engineering.
- Сильный опыт работы с Kubernetes в AWS, GCP или Azure и знакомство с инструментами infrastructure-as-code (Helm, Terraform, Jsonnet и др.).
- Сильный опыт технического лидерства: ведение команды через проекты, наставничество инженеров.
- Опыт эксплуатации мультитенантных систем в production.
- Сильный опыт проектирования и внедрения SLO.
- Опыт с одним или несколькими языками программирования (например, Go, Python, Java).
- Опыт работы с внутренностями ОС Linux, знание сетей, облачного хранения и масштабирования.
- Отличные навыки решения проблем и диагностики.
- Опыт спокойного и активного участия в blame-free реагировании на инциденты, доведения действий до конца и написания качественных пост-инцидентных отчётов (PIR).
- Умение рассуждать о производительности, масштабировании и режимах отказов.
- Комфортная работа в инженерной команде с высокой автономией и самонаправленностью.
- Способность к глубокому партнёрству с продуктовыми командами.
- Ценятся интеллектуальное любопытство, прозрачность, ориентация на действия и доброжелательность.
Условия
- Удалённая работа.
- Рассматриваются кандидаты из Великобритании, Швеции, Испании или Германии.
- Компания полностью удалённая, сотрудники в более чем 40 странах.
- Доступ к современным AI-ассистентам для разработки (инструменты по выбору в рамках политики безопасности) с оплачиваемым компанией бюджетом.
- Доступ к последним моделям OpenAI, Anthropic и Google.
- Ежедневная работа включает регулярные 1:1 с руководителем и коллегами.