Назад к вакансиям
Дата обнаружения: 23 сентября 2026 г.

Staff SRE-инженер по надёжности баз данных

Grafana Labs

ЗарплатаПо договорённости
Страна
Великобритания, Швеция, Испания, Германия
Город
Не указан
Формат
Удалённо
Направления
DevOps
Где отклик
Сайт вакансий

О роли

Grafana Labs — компания, развивающая Grafana Cloud, управляемую платформу наблюдаемости с открытым исходным кодом. Компания полностью удалённая, сотрудники работают в более чем 40 странах.

Ищем Staff Software Engineer — SRE для повышения надёжности облачных баз данных Grafana Cloud, основанных на Mimir, Loki, Tempo и Pyroscope. Базы данных предоставляются как SaaS-продукт на AWS, GCP и Azure во всех регионах. SRE-команда встроена в продуктовые команды Mimir, Loki и Tempo и отвечает за надёжность продуктов для клиентов с высокими SLA.

Задачи

  • Работа в партнёрстве с продуктовыми инженерными командами (встроенная модель).
  • Обеспечение производственной надёжности для сред с высокими SLA и сложных клиентских окружений.
  • Проектирование и внедрение автоматизации для масштабирования практик надёжности.
  • Обеспечение достижения клиентами целей SLO.
  • Определение и развитие SLO и моделей надёжности для отдельных тенантов.
  • Проактивное снижение выгорания SLO для предотвращения повторных инцидентов.
  • Выполнение роли основного эскалационного контакта и дежурного по инцидентам.
  • Руководство реагированием на инциденты, влияющие на клиентов, и проведение пост-инцидентных разборов.
  • Участие в проектировании и ревью кода.
  • Влияние на дизайн функций для обеспечения масштабируемости и эксплуатационной готовности.
  • Создание автоматизации для устранения рутинной работы.
  • Улучшение качества алертов и снижение шумных эскалаций.

Требования

  • 8+ лет инженерного опыта, из них 4+ в SRE/CRE/production engineering. Предпочтителен формальный опыт в customer reliability engineering.
  • Сильный опыт работы с Kubernetes в AWS, GCP или Azure и знакомство с инструментами infrastructure-as-code (Helm, Terraform, Jsonnet и др.).
  • Сильный опыт технического лидерства: ведение команды через проекты, наставничество инженеров.
  • Опыт эксплуатации мультитенантных систем в production.
  • Сильный опыт проектирования и внедрения SLO.
  • Опыт с одним или несколькими языками программирования (например, Go, Python, Java).
  • Опыт работы с внутренностями ОС Linux, знание сетей, облачного хранения и масштабирования.
  • Отличные навыки решения проблем и диагностики.
  • Опыт спокойного и активного участия в blame-free реагировании на инциденты, доведения действий до конца и написания качественных пост-инцидентных отчётов (PIR).
  • Умение рассуждать о производительности, масштабировании и режимах отказов.
  • Комфортная работа в инженерной команде с высокой автономией и самонаправленностью.
  • Способность к глубокому партнёрству с продуктовыми командами.
  • Ценятся интеллектуальное любопытство, прозрачность, ориентация на действия и доброжелательность.

Условия

  • Удалённая работа.
  • Рассматриваются кандидаты из Великобритании, Швеции, Испании или Германии.
  • Компания полностью удалённая, сотрудники в более чем 40 странах.
  • Доступ к современным AI-ассистентам для разработки (инструменты по выбору в рамках политики безопасности) с оплачиваемым компанией бюджетом.
  • Доступ к последним моделям OpenAI, Anthropic и Google.
  • Ежедневная работа включает регулярные 1:1 с руководителем и коллегами.