Назад к вакансиям
remotevibecodingjobs12 августа 2026 г.

Staff-инженер SRE, облачные базы данных

Grafana Labs

ВознаграждениеПо договорённости
Локация
Germany (Remote)
Формат
Удаленка
Направления
Вайбкодинг, DevOps, Дизайнер, Автоматизация, AI-ассистент
Отклик
На remotevibecodingjobs

О компании

Grafana Labs — компания, развивающая открытую платформу наблюдаемости Grafana Cloud. Платформа предоставляется как управляемый сервис. Более 35 миллионов пользователей и 7000+ клиентов, включая Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce. Компания полностью удалённая: 1600+ сотрудников в 40+ странах.

О роли

Ищем Staff-инженера SRE для поддержки самых ценных клиентов Grafana Cloud за счёт повышения надёжности облачных баз данных на основе Mimir, Loki, Tempo и Pyroscope. Базы данных предоставляются как SaaS-продукт из AWS, GCP и Azure во всех регионах. SRE-команда встроена в продуктовые команды Mimir, Loki и Tempo и отвечает за надёжность продуктов баз данных для клиентов с высокими SLA.

Задачи

  • Тесно работать с продуктовыми командами (встроенная модель).
  • Отвечать за производственную надёжность сред с высокими SLA и сложных клиентских окружений.
  • Проектировать и внедрять автоматизацию для масштабирования практик надёжности.
  • Обеспечивать достижение клиентами целей SLO.
  • Определять и развивать пер-тенантные SLO и модели надёжности.
  • Проактивно снижать сжигание SLO для предотвращения повторных инцидентов.
  • Быть основной точкой эскалации и на связи (on-call) при инцидентах.
  • Руководить реагированием на инциденты, влияющие на клиентов, и проводить пост-инцидентные разборы.
  • Участвовать в проектировании (design docs) и ревью кода.
  • Влиять на дизайн функций для обеспечения масштабируемости и эксплуатационной пригодности.
  • Строить автоматизацию для устранения рутинной работы (toil).
  • Улучшать качество алертов и снижать шумные эскалации.

Требования

  • 8+ лет инженерного опыта, из них 4+ в SRE/CRE/production engineering. Предпочтителен формальный опыт в customer reliability engineering.
  • Сильный опыт работы с Kubernetes в AWS, GCP или Azure, знакомство с инструментами infrastructure-as-code (Helm, Terraform, Jsonnet и т.п.).
  • Сильный опыт технического лидерства: ведение команды через проекты, наставничество инженеров, роль force-multiplier.
  • Опыт эксплуатации мультитенантных систем в production.
  • Сильный опыт проектирования и внедрения SLO.
  • Опыт с одним или несколькими языками программирования (например, Go, Python, Java).
  • Опыт с внутренностями операционной системы Linux, базовые знания сетей, облачного хранения и масштабирования.
  • Отличные навыки решения проблем и траблшутинга.
  • Опыт спокойного и активного участия в безобвинительном реагировании на инциденты, отслеживании действий и написании качественных PIR (post-incident reviews).
  • Способность рассуждать о производительности, масштабировании и режимах отказа.
  • Комфортная работа в инженерной команде с высокой степенью автономии и самонаправленности.
  • Способность глубоко взаимодействовать с продуктовыми командами.
  • Ценятся любознательность, прозрачность, склонность к действию и доброжелательность.

Условия

  • Удалённая работа. Рассматриваются кандидаты из Великобритании, Швеции, Испании или Германии.
  • Компания предоставляет оплачиваемый бюджет на использование современных AI-ассистентов для разработки (инструменты на выбор в рамках политики безопасности), а также доступ к передовым моделям (например, GPT-Codex, Claude Opus, Gemini 3 Pro).