О компании
Grafana Labs — компания, развивающая открытую платформу наблюдаемости Grafana Cloud. Платформа предоставляется как управляемый сервис. Более 35 миллионов пользователей и 7000+ клиентов, включая Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce. Компания полностью удалённая: 1600+ сотрудников в 40+ странах.
О роли
Ищем Staff-инженера SRE для поддержки самых ценных клиентов Grafana Cloud за счёт повышения надёжности облачных баз данных на основе Mimir, Loki, Tempo и Pyroscope. Базы данных предоставляются как SaaS-продукт из AWS, GCP и Azure во всех регионах. SRE-команда встроена в продуктовые команды Mimir, Loki и Tempo и отвечает за надёжность продуктов баз данных для клиентов с высокими SLA.
Задачи
- Тесно работать с продуктовыми командами (встроенная модель).
- Отвечать за производственную надёжность сред с высокими SLA и сложных клиентских окружений.
- Проектировать и внедрять автоматизацию для масштабирования практик надёжности.
- Обеспечивать достижение клиентами целей SLO.
- Определять и развивать пер-тенантные SLO и модели надёжности.
- Проактивно снижать сжигание SLO для предотвращения повторных инцидентов.
- Быть основной точкой эскалации и на связи (on-call) при инцидентах.
- Руководить реагированием на инциденты, влияющие на клиентов, и проводить пост-инцидентные разборы.
- Участвовать в проектировании (design docs) и ревью кода.
- Влиять на дизайн функций для обеспечения масштабируемости и эксплуатационной пригодности.
- Строить автоматизацию для устранения рутинной работы (toil).
- Улучшать качество алертов и снижать шумные эскалации.
Требования
- 8+ лет инженерного опыта, из них 4+ в SRE/CRE/production engineering. Предпочтителен формальный опыт в customer reliability engineering.
- Сильный опыт работы с Kubernetes в AWS, GCP или Azure, знакомство с инструментами infrastructure-as-code (Helm, Terraform, Jsonnet и т.п.).
- Сильный опыт технического лидерства: ведение команды через проекты, наставничество инженеров, роль force-multiplier.
- Опыт эксплуатации мультитенантных систем в production.
- Сильный опыт проектирования и внедрения SLO.
- Опыт с одним или несколькими языками программирования (например, Go, Python, Java).
- Опыт с внутренностями операционной системы Linux, базовые знания сетей, облачного хранения и масштабирования.
- Отличные навыки решения проблем и траблшутинга.
- Опыт спокойного и активного участия в безобвинительном реагировании на инциденты, отслеживании действий и написании качественных PIR (post-incident reviews).
- Способность рассуждать о производительности, масштабировании и режимах отказа.
- Комфортная работа в инженерной команде с высокой степенью автономии и самонаправленности.
- Способность глубоко взаимодействовать с продуктовыми командами.
- Ценятся любознательность, прозрачность, склонность к действию и доброжелательность.
Условия
- Удалённая работа. Рассматриваются кандидаты из Великобритании, Швеции, Испании или Германии.
- Компания предоставляет оплачиваемый бюджет на использование современных AI-ассистентов для разработки (инструменты на выбор в рамках политики безопасности), а также доступ к передовым моделям (например, GPT-Codex, Claude Opus, Gemini 3 Pro).