Назад к вакансиям
Дата обнаружения: 22 сентября 2026 г.

Staff-инженер SRE по облачным базам данных

Grafana Labs

ЗарплатаПо договорённости
Страна
Великобритания, Швеция, Испания, Германия
Город
Не указан
Формат
Удалённо
Направления
DevOps
Где отклик
Сайт вакансий

О компании

Grafana Labs — компания, стоящая за Grafana Cloud, полностью управляемой платформой наблюдаемости, которой доверяют более 10 000 организаций. Среди клиентов — Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce. Компания полностью удалённая, сотрудники в более чем 40 странах.

О роли

Ищем Staff Software Engineer (SRE) для поддержки самых ценных клиентов Grafana Cloud за счёт повышения надёжности облачных баз данных на основе Mimir, Loki, Tempo и Pyroscope. Базы данных предоставляются как SaaS-продукт из AWS, GCP и Azure во всех регионах. SRE-команда встроена в продуктовые команды Mimir, Loki и Tempo и отвечает за надёжность продуктов баз данных для клиентов с высокими SLA.

Задачи

  • Тесно работать с продуктовыми инженерными командами (встроенная модель)
  • Отвечать за производственную надёжность сред с высокими SLA и сложных клиентских окружений
  • Проектировать и внедрять автоматизацию для масштабирования практик надёжности
  • Обеспечивать достижение клиентами целей SLO
  • Определять и развивать SLO и модели надёжности для отдельных тенантов
  • Проактивно снижать выгорание SLO для предотвращения повторных инцидентов
  • Быть основной точкой эскалации и на связи (on-call) при инцидентах
  • Руководить реагированием на инциденты, влияющие на клиентов, и пост-инцидентными разборами
  • Участвовать в дизайн-документах и ревью кода
  • Влиять на дизайн функций с учётом масштабируемости и эксплуатационной надёжности
  • Создавать автоматизацию для устранения рутинной работы (toil)
  • Улучшать качество алертов и снижать шумные эскалации

Требования

  • 8+ лет инженерного опыта, из них 4+ в SRE/CRE/production engineering; приветствуется формальный опыт customer reliability engineering
  • Сильный опыт Kubernetes в AWS, GCP или Azure, знакомство с infrastructure-as-code (Helm, Terraform, Jsonnet и т.п.)
  • Сильный опыт технического лидерства: ведение команды через проекты, наставничество и роль force-multiplier
  • Опыт эксплуатации мультитенантных систем в production
  • Сильный опыт проектирования и внедрения SLO
  • Опыт с одним или несколькими языками программирования (например, Go, Python, Java)
  • Опыт с внутренним устройством ОС Linux, базовые знания сетей, облачного хранения и масштабирования
  • Отличные навыки решения проблем и диагностики
  • Опыт спокойного и активного участия в безобвинительном реагировании на инциденты (blame-free Incident Response), доведения действий до конца и написания качественных PIR (post-incident reviews)
  • Умение рассуждать о производительности, масштабировании и режимах отказов
  • Комфортная работа в инженерной команде с высокой автономией и самонаправленностью
  • Способность глубоко партнёрствовать с продуктовыми инженерными командами
  • Ценятся любознательность, прозрачность, склонность к действию и доброта

Условия

  • Удалённая работа; рассматриваем кандидатов из Великобритании, Швеции, Испании или Германии
  • Зарплата по договорённости
  • Компания инвестирует в продуктивность разработчиков: можно использовать современные AI-ассистенты для кодинга (инструменты по выбору в рамках security guidelines) с оплачиваемым компанией бюджетом
  • Поощряется прагматичная AI-ассистированная разработка: быстрое прототипирование, генерация тестов, рефакторинг, документация и разбор инцидентов — в сочетании с сильным код-ревью и стандартами качества
  • Доступны последние frontier-модели OpenAI, Anthropic и Google
  • В повседневной работе — регулярные 1:1 с руководителем и коллегами