Grafana Labs — компания, развивающая Grafana Cloud; полностью удалённая, команда в 40+ странах. Открыта удалённая позиция Staff Software Engineer — SRE для поддержки наиболее ценных клиентов Grafana Cloud за счёт повышения надёжности облачных баз данных на основе Mimir, Loki, Tempo и Pyroscope. Базы данных предоставляются как SaaS на AWS, GCP и Azure во всех регионах. SRE-команда встроена в продуктовые команды Mimir, Loki и Tempo и отвечает за надёжность продуктов баз данных для клиентов с высокими SLA. Кандидаты рассматриваются из Великобритании, Швеции, Испании, Германии или Ирландии.
Задачи
- Тесно взаимодействовать с продуктовыми инженерными командами (встроенная модель)
- Отвечать за производственную надёжность сред клиентов с высокими SLA и сложных окружений
- Проектировать и внедрять автоматизацию для масштабирования практик надёжности
- Обеспечивать достижение клиентами целей SLO
- Определять и развивать SLO и модели надёжности для отдельных тенантов
- Снижать выгорание SLO для предотвращения повторных инцидентов
- Быть основной точкой эскалации и на связи (on-call) при инцидентах
- Руководить реагированием на инциденты, влияющие на клиентов, и посмертными разборами
- Вносить вклад в проектные документы и код-ревью
- Влиять на дизайн функций для обеспечения масштабируемости и управляемости в проде
- Строить автоматизацию для устранения рутинной работы (toil)
- Улучшать качество алертов и снижать шумные эскалации
Требования
- 8+ лет инженерного опыта, из них 4+ в SRE/CRE/production engineering; приветствуется формальный опыт customer reliability engineering
- Сильный опыт работы с Kubernetes в AWS, GCP или Azure и знакомство с инструментами infrastructure-as-code (Helm, Terraform, Jsonnet и т.п.)
- Сильный опыт технического лидерства: ведение команды через проекты, менторство инженеров
- Опыт эксплуатации мультитенантных систем в проде
- Сильный опыт проектирования и внедрения SLO
- Опыт с одним или несколькими языками программирования (например, Go, Python, Java)
- Опыт с внутренностями ОС Linux, знание сетей, облачного хранения и масштабирования
- Отличные навыки решения проблем и диагностики
- Опыт спокойного участия в blame-free реагировании на инциденты, доведения действий до конца и написания качественных PIR (post-incident reviews)
- Умение рассуждать о производительности, масштабировании и режимах отказа
- Комфортная работа в инженерной команде с высокой автономией и самонаправленностью
- Способность к глубокому партнёрству с продуктовыми инженерными командами
- Ценятся любознательность, прозрачность, ориентация на действие и доброжелательность
Условия
- Полностью удалённая работа
- Доступ к современным AI-ассистентам для кодинга (инструменты на выбор в рамках политик безопасности) с оплачиваемым компанией бюджетом
- Поощряется прагматичная AI-assisted разработка: быстрый прототипинг, генерация тестов, рефакторинг, документация и разборы инцидентов — в сочетании с качественным код-ревью
- Доступ к последним frontier-моделям OpenAI, Anthropic и Google
- Регулярные 1:1 с руководителем и коллегами