О компании
Grafana Labs — компания, стоящая за Grafana Cloud, полностью управляемой платформой наблюдаемости, которой доверяют более 10 000 организаций. Среди клиентов — Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce. Компания полностью удалённая, сотрудники в более чем 40 странах.
О роли
Ищем Staff Software Engineer (SRE) для поддержки самых ценных клиентов Grafana Cloud за счёт повышения надёжности облачных баз данных на основе Mimir, Loki, Tempo и Pyroscope. Базы данных предоставляются как SaaS-продукт из AWS, GCP и Azure во всех регионах. SRE-команда встроена в продуктовые команды Mimir, Loki и Tempo и отвечает за надёжность продуктов баз данных для клиентов с высокими SLA.
Задачи
- Тесно работать с продуктовыми инженерными командами (встроенная модель)
- Отвечать за производственную надёжность сред с высокими SLA и сложных клиентских окружений
- Проектировать и внедрять автоматизацию для масштабирования практик надёжности
- Обеспечивать достижение клиентами целей SLO
- Определять и развивать SLO и модели надёжности для отдельных тенантов
- Проактивно снижать выгорание SLO для предотвращения повторных инцидентов
- Быть основной точкой эскалации и на связи (on-call) при инцидентах
- Руководить реагированием на инциденты, влияющие на клиентов, и пост-инцидентными разборами
- Участвовать в дизайн-документах и ревью кода
- Влиять на дизайн функций с учётом масштабируемости и эксплуатационной надёжности
- Создавать автоматизацию для устранения рутинной работы (toil)
- Улучшать качество алертов и снижать шумные эскалации
Требования
- 8+ лет инженерного опыта, из них 4+ в SRE/CRE/production engineering; приветствуется формальный опыт customer reliability engineering
- Сильный опыт Kubernetes в AWS, GCP или Azure, знакомство с infrastructure-as-code (Helm, Terraform, Jsonnet и т.п.)
- Сильный опыт технического лидерства: ведение команды через проекты, наставничество и роль force-multiplier
- Опыт эксплуатации мультитенантных систем в production
- Сильный опыт проектирования и внедрения SLO
- Опыт с одним или несколькими языками программирования (например, Go, Python, Java)
- Опыт с внутренним устройством ОС Linux, базовые знания сетей, облачного хранения и масштабирования
- Отличные навыки решения проблем и диагностики
- Опыт спокойного и активного участия в безобвинительном реагировании на инциденты (blame-free Incident Response), доведения действий до конца и написания качественных PIR (post-incident reviews)
- Умение рассуждать о производительности, масштабировании и режимах отказов
- Комфортная работа в инженерной команде с высокой автономией и самонаправленностью
- Способность глубоко партнёрствовать с продуктовыми инженерными командами
- Ценятся любознательность, прозрачность, склонность к действию и доброта
Условия
- Удалённая работа; рассматриваем кандидатов из Великобритании, Швеции, Испании или Германии
- Зарплата по договорённости
- Компания инвестирует в продуктивность разработчиков: можно использовать современные AI-ассистенты для кодинга (инструменты по выбору в рамках security guidelines) с оплачиваемым компанией бюджетом
- Поощряется прагматичная AI-ассистированная разработка: быстрое прототипирование, генерация тестов, рефакторинг, документация и разбор инцидентов — в сочетании с сильным код-ревью и стандартами качества
- Доступны последние frontier-модели OpenAI, Anthropic и Google
- В повседневной работе — регулярные 1:1 с руководителем и коллегами