Назад к вакансиям
remotevibecodingjobs12 августа 2026 г.

Staff-инженер по надежности баз данных

Grafana Labs

ВознаграждениеПо договорённости
Локация
Republic of Ireland (Remote)
Формат
Удаленка
Направления
Вайбкодинг, Веб-разработка, DevOps, Дизайнер, Автоматизация, AI-ассистент
Отклик
На remotevibecodingjobs

Компания: Grafana Labs.

Формат: удалённая работа. Рассматриваются кандидаты из Великобритании, Швеции, Испании, Германии или Ирландии.

Роль: Staff Software Engineer — SRE для облачных баз данных Grafana Cloud (Mimir, Loki, Tempo, Pyroscope). Базы данных предоставляются как SaaS на AWS, GCP и Azure во всех регионах. SRE-команда встроена в продуктовые группы Mimir, Loki и Tempo.

Задачи

  • Тесное партнёрство с продуктовыми инженерными командами (встроенная модель).
  • Обеспечение надёжности production-среды для клиентов с высокими SLA и сложных окружений.
  • Проектирование и внедрение автоматизации для масштабирования практик надёжности.
  • Обеспечение достижения клиентами целевых показателей SLO.
  • Определение и развитие пер-тенантных SLO и моделей надёжности.
  • Проактивное снижение выгорания SLO для предотвращения повторных инцидентов.
  • Выполнение роли основного эскалационного контакта и дежурного (on-call) при инцидентах.
  • Руководство разбором инцидентов, влияющих на клиентов, и пост-инцидентными ревью.
  • Участие в проектировании (design docs) и код-ревью.
  • Влияние на дизайн функций для обеспечения масштабируемости и эксплуатационной пригодности.
  • Создание автоматизации для устранения рутинной работы (toil).
  • Улучшение качества алертов и снижение шумных эскалаций.

Требования

  • 8+ лет инженерного опыта, из них 4+ в SRE/CRE/production engineering. Предпочтителен формальный опыт в customer reliability engineering.
  • Сильный опыт работы с Kubernetes на AWS, GCP или Azure, знакомство с инструментами infrastructure-as-code (Helm, Terraform, Jsonnet и т.п.).
  • Сильный опыт технического лидерства: ведение команды через проекты, наставничество инженеров, роль force-multiplier.
  • Опыт эксплуатации мульти-тенантных систем в production.
  • Сильный опыт проектирования и внедрения SLO.
  • Опыт с одним или несколькими языками программирования (например, Go, Python, Java).
  • Опыт с внутренностями ОС Linux, знание сетей, облачного хранения и масштабирования.
  • Отличные навыки решения проблем и диагностики.
  • Опыт спокойного и активного участия в blame-free инцидент-менеджменте, выполнения последующих действий и написания качественных PIR (Post Incident Reviews).
  • Умение рассуждать о производительности, масштабировании и режимах отказов.
  • Комфортная работа в инженерной команде с высокой степенью автономии и самонаправленности.
  • Способность к глубокому партнёрству с продуктовыми командами.
  • Ценятся интеллектуальное любопытство, прозрачность, склонность к действию и доброта.

Условия

  • Удалённая работа (из указанных стран).
  • Компания предоставляет бюджет на использование современных AI-ассистентов для кодирования (в рамках политики безопасности), а также доступ к передовым моделям (например, GPT-Codex 5/3, Claude Opus 4.6, Gemini 3 Pro).