DevOps
Grafana
Дашборды, метрики и наблюдаемость
Коротко
Что это за инструмент
Дашборды, метрики и наблюдаемость.
Вакансии с Grafana
Только вакансии, в описании которых прямо указан Grafana.
DevOps-инженер, AI-инфраструктура и CI/CD
- Формат
- Офис
- Страна
- Россия
- Город
- Не указан
Компания «Ай-Теко» — ведущий российский системный интегратор и поставщик IT-решений для корпоративных заказчиков. Компания работает на рынке с 1997 года и входит в число крупнейших IT-компаний России. Формат работы Офис, Москва. Занятость: полная. Обязательно полное высшее образование. Задачи - Поддерживать и развивать DevOps-инфраструктуру AI-проектов. - Работать с Docker и Kubernetes. - Использовать Ansible, ArgoCD и Terraform. - Строить и поддерживать CI/CD на GitLab CI / Jenkins. - Работать с мониторингом и логированием: Prometheus / VictoriaMetrics, Grafana, Loki / ELK. - Администрировать Linux и разбираться в сетевых взаимодействиях микросервисной архитектуры. - Изучать новые технологии: мультиагентные фреймворки, RAG, MCP. - Предлагать и внедрять улучшения инфраструктуры. Требования - Коммерческий опыт работы DevOps от 3 лет. - Уверенное владение Docker и Kubernetes. - Опыт с Ansible, ArgoCD, Terraform. - Понимание CI/CD. - Опыт работы с системами мониторинга и логирования. - Знание Linux и основ сетевого взаимодействия. - Готовность разбираться в AI и агентных технологиях. Будет плюсом - Понимание жизненного цикла AI-агентов и ML-моделей. - Опыт разработки и развёртывания автономных AI-агентов. - Практический опыт с MCP и RAG. - Опыт работы с платформами оркестрации агентов или serverless-средами. - Опыт интеграции корпоративных систем (OneWork, SberSpace). - Интерес к AI и агентным системам. Условия - Стабильная работа в крупной IT-компании. - Официальное оформление по ТК РФ с первого дня. - «Белая» заработная плата. - Расширенный ДМС, включая стоматологию. - Корпоративные скидки на фитнес. - Футбольная и волейбольная секции. - Профессиональное обучение и развитие. - Насыщенная корпоративная жизнь. - Современная техника: мощный ноутбук предоставят уже в день оформления. Важно: работа только из офиса в Москве.
Staff Backend-инженер, базы данных Tempo
- Формат
- Удалённо
- Страна
- Канада
- Город
- Не указан
Grafana Labs — компания, стоящая за Grafana Cloud, полностью управляемой платформой наблюдаемости, которой доверяют более 10 000 организаций. Мы — полностью удаленная компания с сотрудниками в более чем 40 странах. Клиенты включают Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce. Это удаленная позиция. Мы ищем кандидатов в США и Канаде. Мы создаем Tempo — open-source бэкенд распределенного трейсинга, лежащий в основе Grafana Cloud Traces и Grafana Enterprise Traces (GET). Tempo упрощает поиск трейсов, генерацию метрик из спанов и связывание данных трейсинга с логами, метриками и профилями в стеке Grafana. 2026 год — переломный момент для Tempo. После крупного архитектурного обновления и запуска TraceQL metrics мы переходим от фундаментальной работы к продуктовому и операционному совершенству, превращая Tempo из SaaS-базы данных в платформу для следующего поколения продуктов наблюдаемости Grafana (App Observability, Asserts, Traces Drilldown и AI-ассистенты). В течение следующего года вы поможете нам: - Сделать Grafana Cloud Traces «просто работающим» для клиентов, устранив шероховатости, запутанные лимиты и скрытые сбои. - Достичь операционного совершенства в масштабе: рост с почти 50 ячеек сегодня до трехзначных чисел в этом году, с автоскейлингом, параметризованными раскатками и агрессивным сокращением рутинной работы. - Развить Tempo в платформу: API с более высокой плотностью, агрегация трейсов, математика TraceQL metrics и интерфейсы, удобные для машин и LLM, на которых смогут строить downstream-продукты и агенты. - Улучшить производительность: снизить задержки запросов при приеме сотен МБ/с и обеспечить производительные диапазоны запросов за 30 дней для соответствия конкурентам. - Подготовить Tempo к миру, управляемому агентами: более крупные, более всплесковые и высококардинальные нагрузки, а также новые категории AI-рабочих процессов, такие как триаж с помощью ассистентов и расследования в стиле «почему это медленно?». Что вы будете делать: Как Staff-инженер в команде Tempo, вы будете задавать техническое направление по самым сложным задачам дорожной карты и поднимать планку для всей команды. - Вести многоквартальные технические инициативы от формулировки проблемы до раскатки, например, API агрегации трейсов, Limitless Tempo, автоскейлинг ячеек и лимиты клиентов или улучшения движка запросов. - Владеть архитектурой ключевых компонентов Tempo: прием, хранение, запросы и генерация метрик. Проводить ревью дизайна, принимать решения по компромиссам между производительностью, стоимостью и сложностью, документировать «почему» для команды. - Проектировать API для людей и агентов. Формировать следующее поколение интерфейсов Tempo (структурированных, детерминированных, обнаруживаемых), чтобы продукты Act 3, LLM-ассистенты и внешние интеграторы могли надежно строить на Tempo. - Обеспечивать операционное совершенство. Отвечать за конкретные SLO (P99 задержка записи, повторяемость инцидентов, TCO на принятый ГБ) и вести команду к Zero Ops через автоматизацию, параметризованные раскатки и действенные алерты. - Работать с Product и смежными командами. Тесно сотрудничать с PM и командами App Observability, Asserts, Drilldown и Grafana Assistant, чтобы понимать, как потребляется Tempo, и поставлять то, что их разблокирует. - Наставлять инженеров. Поднимать инженерную планку через ревью кода, обратную связь по дизайну, парное решение сложных задач и письменные материалы, которые делают команду умнее. - Участвовать в on-call для сервисов, которые вы помогаете создавать, и быть мультипликатором силы в реагировании на инциденты и пост-инцидентном обучении. - Вносить вклад в open source. Tempo — OSS-проект. Вы будете взаимодействовать с сообществом, ревьюить внешние контрибуции и помогать вести проект открыто. Мы много инвестируем в продуктивность разработчиков. Вы можете использовать современные AI-ассистенты кодирования в ежедневном рабочем процессе (на ваш выбор инструментов, в рамках политики безопасности) с оплачиваемым компанией бюджетом на использование.
Senior Fullstack-инженер, Grafana Cloud Observability
- Формат
- Удалённо
- Страна
- Канада
- Город
- Не указан
- Грейд
- Senior
Grafana Labs — компания, стоящая за Grafana Cloud, полностью управляемой платформой наблюдаемости, которой доверяют более 10 000 организаций для обеспечения надежности, ускорения устранения инцидентов и оптимизации телеметрии в масштабе. Платформа построена на открытом исходном коде и открытых стандартах, предназначена для совместимости с любым стеком и объединяет ИИ с наблюдаемостью. Среди клиентов — Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce. Компания полностью удаленная, команда распределена по более чем 40 странам. Это полная занятость, удаленно. Рассматриваются кандидаты только из США и Канады (часовой пояс EST). Отдел Grafana Cloud Observability занимается созданием инструментов, позволяющих разработчикам понимать состояние и производительность своих приложений и инфраструктуры в любой среде: инструментировать код, собирать данные наблюдаемости в Grafana Cloud, визуализировать и исследовать их. В этой роли вы присоединитесь к команде Cloud Integrations, которая разрабатывает портфель интеграций для сбора, визуализации и работы с телеметрией из различных систем и приложений. Создаваемое вами программное обеспечение — ключевой строительный блок для пользователей Grafana Cloud, напрямую влияющий на качество работы «из коробки». Работа строится на открытых технологиях, таких как Prometheus и OpenTelemetry, в развитие которых вы также сможете вносить вклад. Задачи: - Разрабатывать инструменты, обеспечивающие работу портфеля облачных интеграций и приложений наблюдаемости; развивать, поддерживать и масштабировать функции наблюдаемости инфраструктуры в Grafana Cloud. - Работать на всем стеке: фронтенд на TypeScript/React, бэкенд на Golang, мониторинг-миксины на Jsonnet. - Выпускать функции целиком — от пользовательского интерфейса до бэкенд-сервисов, дашбордов и алертов, поставляемых с каждой интеграцией. - Переключаться между частями стека по мере необходимости: иногда это React-панель, иногда Go-сервис, иногда Jsonnet-миксин. - Вести проекты от постановки задачи до продакшена, включая общение с пользователями и проверку эффективности выпущенного. - Представлять работу команды вовне: писать дизайн-предложения, проводить демо, отстаивать дорожную карту в кросс-командных обсуждениях. - Вносить вклад в upstream Prometheus, OpenTelemetry и Grafana Alloy. - Участвовать в дежурствах (on-call) для сервисов, за которые вы отвечаете. Требования: - Интерес к работе на всем стеке с продуктовым мышлением: вы начинаете с проблемы пользователя и уверенно решаете, что строить, а не только как. - Опыт и в бэкенде, и во фронтенде. Используются Go и TypeScript; уверенный опыт с сопоставимыми языками подходит. - Свободное владение ИИ-ассистированной разработкой: вы используете кодинг-агентов и LLM-инструменты в работе и четко понимаете, где они ускоряют процесс, а где мешают. - Готовность быть на виду: вы рано поднимаете вопросы, отстаиваете работу команды в обсуждениях. Условия: - Полная удаленная работа. - Компания инвестирует в продуктивность разработчиков: доступ к современным ИИ-кодинг-ассистентам в рамках ежедневного рабочего процесса (инструменты на ваш выбор в пределах политик безопасности) с оплачиваемым компанией бюджетом использования. - Доступ к последним frontier-моделям от OpenAI, Anthropic и Google. - В связи с удаленным форматом важны сильные коммуникационные навыки и способность работать самостоятельно; поддержка и регулярные встречи проводятся по видеосвязи.
Senior QA Automation Developer, платформа
- Формат
- Офис
- Страна
- Канада
- Город
- Не указан
- Грейд
- Senior
Компания Upgrade помогает клиентам двигаться в правильном направлении с доступными и ответственными финансовыми продуктами. С 2017 года компания помогла более 7,5 миллиона клиентов получить доступ к более чем 42 миллиардам долларов потребительского кредита. Компания сосредоточена на улучшении финансового благополучия клиентов и создает продукты, которые поддерживают их путь к лучшему финансовому будущему. Upgrade поддерживается ведущими технологическими инвесторами и недавно была оценена в 7,3 миллиарда долларов. Компания признана одним из ведущих мировых финтех-компаний по версии CNBC, лучшим местом работы по версии Built In и San Francisco Business Times, одним из величайших мест работы в Америке по версии Newsweek, лучшим стартап-работодателем по версии Forbes и одним из самых здоровых работодателей по версии Phoenix Business Journal. Роль: команда QA-Core существует для того, чтобы каждая инженерная команда Upgrade могла быстро тестировать свое программное обеспечение и доверять результатам. Ищем Senior QA Automation Engineer для архитектуры и создания инфраструктуры автоматизации тестирования, инструментов и агентных решений для повышения продуктивности инженеров. Это не традиционная роль QA-продукта, а роль по созданию. Вы будете тесно работать с продуктовыми командами, чтобы понять их требования к автоматизации, проектировать сервисы с нуля, запускать их в production-кластерах и владеть ими. Это полностью удаленная позиция для кандидатов, находящихся в Канаде. Основные технологии: Java, Python, Kubernetes, Selenium WebDriver, Playwright, TestNG, Maven, Git, Jenkins, ArgoCD, SQL, Grafana, SumoLogic, Docker, Gatling, Claude Code, MCP server. Задачи: - Проектирование и владение фреймворком автоматизации для функционального и нагрузочного тестирования. - Создание агентов для автоматизации существующих QA-процессов и устранения инженерных препятствий. - Создание приложений и сервисов, от которых зависит автоматизация, их развертывание и эксплуатация в production-среде. - Доведение прототипов до конца: создание демо, сбор обратной связи от команд, итерации до зрелого, отслеживаемого и качественного состояния. - Выявление пробелов в существующих фреймворках и инструментах и поиск решений для их устранения. Требования: - 5-7+ лет опыта создания production-программного обеспечения с глубиной в тестовой инфраструктуре, тестовых фреймворках и инструментах для разработчиков, а также знание платформенной инженерии. - Подтвержденный опыт создания агентных решений и фреймворков автоматизации тестирования с нуля — от проектирования до внедрения в рабочий процесс других инженеров. - Свободное владение агентными инструментами кодирования в повседневной работе: умение оркестрировать несколько агентов, выполнять и ревьюить сгенерированные агентами PR. - Практический опыт работы с микросервисами, Kubernetes и управлением жизненным циклом развертывания. - Способность самостоятельно превращать неоднозначную постановку задачи в конкретное и защитимое решение. Условия: - Конкурентная зарплата и опционный план на акции. - Оплачиваемая медицинская, стоматологическая и офтальмологическая страховка. - Гибкий график отпусков. - Возможности профессионального роста и развития. - Оплачиваемый отпуск по уходу за ребенком. - Инициативы по здоровью и благополучию. Условия работы: работа выполняется в помещении в динамичной среде, требующей управления несколькими приоритетами и соблюдения установленных рабочих процессов и графиков. Сотрудники регулярно вводят, получают и обмениваются информацией с помощью цифровых систем. Роль требует обмена информацией с клиентами, коллегами, руководителями и партнерами через встречи, электронную почту, телефон и цифровые инструменты. Работа может выполняться в контакт-центре, офисе или удаленно в зависимости от бизнес-потребностей. Удаленные сотрудники отвечают за поддержание безопасного и продуктивного рабочего пространства с надежным интернетом.
Data Scientist / ML-инженер, NLP
- Формат
- Офис
- Страна
- Россия
- Город
- Не указан
Обязанности: - исследование и внедрение современных подходов для широкого круга NLP-задач; - участие в полном цикле разработки: от прототипирования до промышленного развёртывания конечного решения; - разработка сервисов обработки естественного языка (классификация, суммаризация, NER, RAG и пр.); - участие в создании AI-ассистентов на базе генеративных моделей (SFT/LoRA, RLHF) — BERT, Qwen и др.; - сотрудничество с продуктовыми, техническими и клиентскими командами; - построение пайплайнов подготовки данных и обучения LLM (LLM-цепочки); - организация процесса мониторинга качества и производительности LLM в продакшене; - проектирование и поддержка CI/CD-конвейеров для ML-проектов (Git, GitLab CI/CD, Jenkins и подобные); - контейнеризация и оркестрация сервисов (Docker, Kubernetes); - настройка систем логирования и мониторинга (Prometheus, Grafana) для ML сервисов. Требования: - высшее образование: математическое, IT, техническое; - аналогичный опыт работы от 1 года; - хорошее знание Python и основных библиотек анализа данных; - базовые навыки классического ML (EDA, предобработка, обучение моделей); - понимание основных метрик оценки качества моделей; - опыт применения современных трансформерных нейросетей (GPT, BERT и их модификаций); - опыт реализации RAG; - уверенное владение PyTorch или TensorFlow для тонкой настройки LLM; - опыт работы с инструментами CI/CD (Git, GitLab CI/CD, Jenkins и пр.); - умение работать Docker, Kubernetes. Условия: - оформление по ТК РФ с первого дня и все социальные гарантии; - офисный формат работы (удаленка возможна, если вы проживаете в регионе, где нет офиса IBS); - комфортные офисы в городах присутствия: с зонами для работы, переговорными комнатами, отдельными зонами отдыха и развлечения, спортивными уголками; - предоставляются ноутбук, наушники, мышь, при необходимости — другая техника; - условия для карьерного роста и программы профессионального развития; - оплачиваемое профессиональное обучение и сертификация; - бонусы и бенефиты: подарки для детей, оплата мобильной связи, конкурсы и квизы с призами, скидки у корпоративных партнёров, покупка мерча за виртуальную игровую валюту; - неформальные мероприятия, интеллектуальные игры, спортивные клубы, собственная Киберлига, возможность заниматься волонтерской деятельностью и благотворительностью, творческие вечера.
MLOps-инженер, DevOps с ML-спецификой
- Формат
- Офис
- Страна
- Россия
- Город
- Не указан
Компания СОГАЗ, блок IT, центр внедрения ИИ. Проект: продуктовая ML-платформа, генеративные AI-ассистенты и классические модели машинного обучения. Формат работы — полный офис в бизнес-центре у м. Курская. Обязанности: - Проектировать архитектуру AI-систем; - Внедрение GPU-планировщика для шаринга нагрузки на одном железе; - Проектирование и поддержка ML-пайплайнов; - CI/CD для моделей: версионирование данных, моделей, экспериментов; - Мониторинг production-моделей; - Деплой и оптимизация LLM / inference-серверов; - Контейнеризация и оркестрация сервисов; - CI/CD (GitLab CI); - Мониторинг и observability (Prometheus, Grafana); - Обеспечение выполнения требований ИБ в отношении инфраструктуры. Требования: - Бэкграунд в ML/DS — понимание процессов обучения, инференса, работы с данными; - Опыт от 2 лет в MLOps / DevOps с ML-спецификой; - Docker, Kubernetes — production-опыт; - CI/CD (GitLab CI, методология GitOps); - Глубокие знания Linux; - Опыт построения или управления GPU-кластерами (NVIDIA, CUDA, nvidia-container-toolkit); - Понимание специфики multi-tenant GPU-шаринга (MIG, MPS, time-slicing); - Опыт работы с LLM / inference-серверами (vLLM, TGI, Triton); - Опыт с GPU-планировщиками; - Опыт с MLflow, Kubeflow, Airflow или аналогами; - Высшее техническое образование. Условия: - Оформление полностью в соответствии с ТК РФ, включая оплачиваемый отпуск 29 календарных дней (плюс 1 день отпуска); - ДМС в лучших клиниках города, страхование жизни и страхование от несчастных случаев и болезней + ДМС родственников с 75% скидкой; - Премиальные условия на всю продуктовую линейку группы компаний «СОГАЗ» для работников и их близких родственников (ОСАГО, каско, имущество, жизнь); - Социальный пакет и специальные предложения по страхованию, кредитованию и другие программы от партнёров; - Профессиональное развитие: курсы, тренинги, корпоративная библиотека; - Забота о детях сотрудников: подарки на Новый год и скидки в детские лагеря.
Senior FullStack-инженер, Grafana Cloud Observability
- Формат
- Удалённо
- Страна
- Канада
- Город
- Не указан
- Грейд
- Senior
Grafana Labs — компания, развивающая Grafana Cloud, управляемую платформу наблюдаемости, которой доверяют более 10 000 организаций. Компания полностью удалённая, сотрудники работают в более чем 40 странах. Продукт построен на открытом исходном коде и открытых стандартах. Роль в команде Cloud Integrations департамента Grafana Cloud Observability. Команда разрабатывает портфель интеграций, позволяющих клиентам собирать, визуализировать и реагировать на телеметрию из различных систем и приложений. Работа строится на открытых технологиях, таких как Prometheus и OpenTelemetry, в которые можно вносить вклад. Задачи: - Разрабатывать инструменты для портфеля облачных интеграций и приложений наблюдаемости. - Работать во всём стеке: фронтенд на TypeScript/React, бэкенд на Golang, мониторинг-миксины на Jsonnet. - Реализовывать функции целиком: от пользовательского интерфейса до серверных сервисов, дашбордов и алертов. - Переключаться между частями стека по мере необходимости. - Вести проекты от постановки задачи до продакшена, включая общение с пользователями и проверку результатов. - Представлять работу команды: писать дизайн-предложения, проводить демо, отстаивать дорожную карту в кросс-командных обсуждениях. - Вносить вклад в upstream Prometheus, OpenTelemetry и Grafana Alloy. - Участвовать в дежурствах (on-call) для сервисов, за которые отвечаете. Требования: - Интерес к работе во всём стеке и продукт-ориентированное мышление. - Опыт в бэкенде и фронтенде: Go и TypeScript (уверенный опыт с сопоставимыми языками также подходит). - Владение AI-assisted разработкой: использование кодинг-агентов и LLM-инструментов, понимание их сильных и слабых сторон. - Готовность быть заметным: поднимать вопросы заранее, отстаивать работу команды. - Сильные коммуникационные навыки и способность работать самостоятельно (в связи с удалённой работой). Условия: - Полная занятость, удалённо. - Рассматриваются кандидаты из США и Канады (часовой пояс EST). - Компания инвестирует в продуктивность разработчиков: предоставляется бюджет на AI-ассистентов, доступ к современным моделям от OpenAI, Anthropic и Google. - Регулярные встречи по видеосвязи для эффективной коллаборации.
Staff-бэкенд-инженер, базы данных Tempo
- Формат
- Удалённо
- Страна
- Канада
- Город
- Не указан
Компания Grafana Labs развивает Tempo — опенсорсный бэкенд распределённой трассировки, лежащий в основе Grafana Cloud Traces и Grafana Enterprise Traces. Позиция удалённая, рассматриваются кандидаты из США и Канады. В 2026 году Tempo проходит точку перелома: после крупного архитектурного обновления и запуска TraceQL metrics команда переходит от фундаментальной работы к продуктовому и операционному совершенству, превращая Tempo из SaaS-базы данных в платформу для следующего поколения продуктов наблюдаемости Grafana (App Observability, Asserts, Traces Drilldown и AI-ассистентов). В течение следующего года предстоит: - Сделать Grafana Cloud Traces «просто работающим» для клиентов: убрать шероховатости, запутанные лимиты и скрытые режимы отказов. - Достичь операционного совершенства в масштабе: рост с почти 50 ячеек (cells) сегодня до трёхзначного числа в этом году, с автоскейлингом, параметризованными раскатками и агрессивным сокращением рутинной работы (toil). - Развивать Tempo как платформу: API с более высокой плотностью, агрегация трейсов, вычисления TraceQL metrics, интерфейсы, удобные для машин и LLM, на которых смогут строить downstream-продукты и агенты. - Улучшать производительность: снижение задержек запросов при приёме сотен МБ/с и быстрые запросы за 30-дневные диапазоны, чтобы соответствовать конкурентам. - Готовить Tempo к миру, управляемому агентами: более крупные, «взрывные» нагрузки с высокой кардинальностью и новые категории AI-рабочих процессов, таких как ассистентская триаж и расследования вида «почему это медленно?». Обязанности Staff-инженера: - Вести многоквартальные технические инициативы от постановки проблемы до раскатки: например, API агрегации трейсов, Limitless Tempo, автоскейлинг ячеек и клиентские лимиты, улучшения query-движка. - Отвечать за архитектуру ключевых компонентов Tempo: приём (ingestion), хранение, запросы и генерация метрик. Проводить дизайн-ревью, принимать решения по компромиссам между производительностью, стоимостью и сложностью, документировать «почему». - Проектировать API для людей и агентов: формировать следующее поколение интерфейсов Tempo (структурированных, детерминированных, обнаруживаемых), чтобы продукты Act 3, LLM-ассистенты и внешние интеграторы могли надёжно строить на Tempo. - Обеспечивать операционное совершенство: отвечать за конкретные SLO (P99 задержка записи, повторяемость инцидентов, TCO на принятый ГБ) и двигать команду к Zero Ops через автоматизацию, параметризованные раскатки и действенные алерты. - Работать с продактом и смежными командами: с PM и командами App Observability, Asserts, Drilldown и Grafana Assistant, чтобы понимать, как потребляется Tempo, и поставлять то, что их разблокирует. - Наставлять инженеров: повышать планку через код-ревью, обратную связь по дизайну, парное программирование над сложными задачами и тексты, которые делают команду умнее. - Участвовать в on-call для сервисов, которые вы помогаете создавать, и быть мультипликатором силы в реагировании на инциденты и пост-инцидентном обучении. - Вносить вклад в опенсорс: Tempo — OSS. Взаимодействовать с сообществом, ревьюить внешние контрибуции и помогать вести проект открыто. Условия: - Полная удалённость (100% remote), найм в США и Канаде. - Компания инвестирует в продуктивность разработчиков: можно использовать современные AI-кодинг-ассистенты в ежедневной работе (инструменты на выбор, в рамках политик безопасности) с оплачиваемым компанией бюджетом на использование.
Директор по производственной инженерии, DevOps/SRE
- Формат
- Офис
- Страна
- США
- Город
- Не указан
Компания Legion ищет директора по производственной инженерии (DevOps/SRE). Позиция удалённая, США. О позиции: Кандидат будет отвечать за надёжность, автоматизацию и безопасность производственной среды. Инфраструктура работает на AWS с использованием EKS, RDS и других нативных сервисов. Роль предполагает сочетание стратегического руководства и практической работы: около 20–30% времени — непосредственный вклад в архитектуру, инструменты и реагирование на инциденты, остальное — видение, дорожная карта и координация команд. Обязанности: - Нанимать и развивать глобально распределённую команду DevOps/SRE: подбор, менторство, управление инженерами, формирование культуры ответственности и непрерывного улучшения. - Отвечать за дорожную карту надёжности и инфраструктуры для AWS-среды, включая EKS, RDS и связанные сервисы, обеспечивая масштабируемость, высокую доступность и экономическую эффективность. - Руководить практикой SecOps: управление уязвимостями, обнаружение угроз, реагирование на инциденты и устранение последствий. - Определять и продвигать OKR для инфраструктуры, автоматизации и безопасности, отслеживать прогресс по измеримым результатам. - Внедрять лучшие практики наблюдаемости и алертинга (например, Datadog), включая автоматизацию триажа и реагирования для сокращения времени восстановления. - Понимать инфраструктуру агентного ИИ и применение агентных ИИ-процессов в SDLC и DevOps (автоматизированное расследование, исправление, генерация PR). - Развивать практики Infrastructure-as-Code, CI/CD и автоматизации для повышения скорости разработки и снижения рутинных операций. - Согласовывать с командами инженерии и IT стандарты инфраструктуры, контроль доступа, инструменты и требования соответствия. - Обеспечивать соответствие платформы высоким стандартам безопасности, соответствия и защиты данных; поддерживать контроль безопасности и готовность к аудиту. - Участвовать в ротации дежурств по управлению инцидентами совместно с SRE и командами разработки для достижения целей доступности. - Отслеживать актуальные практики в облаке, DevOps и безопасности, давать технические рекомендации и развивать инженерную организацию. Требования: - 8–12 лет опыта в DevOps, SRE или производственной инфраструктуре, включая управление людьми. - Глубокий практический опыт эксплуатации production-нагрузок на AWS: EKS (Kubernetes), RDS, а также VPC, IAM, Lambda, S3. - Подтверждённый опыт в SecOps: управление уязвимостями, реагирование на инциденты, устранение проблем безопасности в production. - 5+ лет работы с платформами наблюдаемости (Datadog, Prometheus, Grafana) для повышения надёжности, производительности и качества алертинга. - Сильный опыт с Infrastructure-as-Code (Terraform, CloudFormation) и автоматизацией CI/CD. - Владение хотя бы одним из языков: Go, Python или Bash; ежедневное использование Git и пайплайнов тестирования. - Практический опыт эксплуатации Linux/Unix production-платформ (Amazon Linux, Ubuntu, RHEL/CentOS). - Подтверждённый опыт кросс-функционального взаимодействия с инженерией и IT по инфраструктуре, инструментам и стандартам безопасности. - Опыт управления инцидентами и on-call практиками для высоконагруженных систем. - Степень бакалавра в Computer Science, инженерии или смежной области обязательна; магистерская степень приветствуется. Предпочтительные требования: - Опыт с другими облачными провайдерами: Google Cloud Platform или Oracle Cloud Infrastructure (OCI). - Профильные сертификаты по безопасности: CISSP, AWS Security Specialty, CKS. - Опыт с фреймворками соответствия: SOC 2, ISO 27001, HIPAA. - 3+ года работы с Kubernetes или другими системами оркестрации контейнеров в масштабе. - Опыт с Kubernetes-нативными инструментами доставки: Argo Workflows, Helm. - 5+ лет руководства командами в agile/scrum среде. - Опыт создания или масштабирования автоматизированных пайплайнов расследования и исправления ошибок в production. Условия: - Зарплата: $220 000 – $265 000 в год + бонус + акции компании.
Senior Backend-разработчик, Python / Scraping
- Формат
- Удалённо
- Страна
- Не указана
- Город
- Не указан
- Грейд
- Senior
Компания CyberYozh — международная экосистема компаний в сфере кибербезопасности, образования и технологий. Формат Удалённо, полная занятость. Зарплата От $4,000 до $5,500+ на руки, в зависимости от глубины экспертизы. Стек Python, Django Rest Framework, FastAPI, Prometheus, Grafana, Docker, Strawberry, Celery, Redis, PostgreSQL, Kubernetes. Требования - Опыт работы в продуктовой компании, чей основной продукт — скрапер, парсер или агрегатор данных. Понимание специфики сбора данных, работы с очередями задач, прокси, обхода антибот-систем и структурирования собранной информации. - Python на уровне Senior (более 8 лет коммерческой разработки) и навыки работы с AI для ускорения (используется ClodeCode). - Глубокий опыт разработки и поддержки API. - Понимание принципов работы Kubernetes и контейнеризации. Задачи - Разработка, тестирование и интеграция API-функционала для продуктов экосистемы. - Работа с бэкенд-частью скрапинг-инфраструктуры: управление задачами парсинга, обработка и отдача собранных данных через API. - Участие в планировании архитектуры, предложение улучшений и рефакторинг. - Поддержка стабильности, мониторинг и сопровождение решений. - Взаимодействие с командами Frontend, DevOps и QA. Условия - Регулярный пересмотр дохода (раз в 6–12 месяцев). - Полная удалёнка, гибкий график работы. - Официальный долгосрочный контракт с международной компанией (компания на рынке 11 лет). - Сильная команда без джунов (в технической команде 20+ человек на разных продуктах). - Отпуск: 28 дней. - Свобода в принятии технических решений. - Работа с передовыми AI-технологиями, получение опыта в нише кибербезопасности и обработки больших данных.
GenAI-разработчик, RAG и LLM-системы
- Формат
- Удалённо
- Страна
- Не указана
- Город
- Не указан
Аккредитованная ИТ-компания «Системы и Алгоритмы» ищет GenAI-разработчика. Условия: - Зарплата: 230 000 рублей gross. - Формат: удалённо. - Занятость: полная. - Трудоустройство: ТД/ИП/СЗ/ГПХ. Требования: - Понимание архитектуры, возможностей и ограничений современных языковых моделей. - Опыт работы с embeddings, vector search, RAG, structured output и tool calling. - Опыт построения evals для LLM-систем, оценки качества ответов, контроля галлюцинаций и мониторинга поведения системы. - Опыт работы с API языковых моделей, Hugging Face и одним из orchestration-фреймворков. - Опыт работы с Airflow, MLflow, Kafka, Redis, Kubernetes, Prometheus и Grafana. - Опыт эксплуатации GPU-инфраструктуры и оптимизации inference. - Опыт fine-tuning или адаптации LLM, включая LoRA / PEFT. - Опыт проектирования agentic workflows или multi-agent-систем. - Понимание принципов информационной безопасности, privacy и работы с персональными данными. Задачи: - Разработка сервисов ИИ-платформы для создания функциональных агентов и ИИ-ассистентов. - Подготовка бэкенда для функциональных агентов, включая среду разработки агентов: тестирование фреймворков, opensource-агенты. - Разработка сервиса управления реестром и скиллами агентов. - Создание единого сервиса для всех баз знаний, интеграция крупных корпоративных источников.
ML-инженер, NLP и LLM
- Формат
- Офис
- Страна
- Россия
- Город
- Не указан
Обязанности: - Разработка ИИ-ассистентов и функциональных агентов в рамках проверки PoC для ИИ-идей, входящих в ИИ-инкубатор. - Практическое применение знаний в NLP. - Запуск моделей на GPU и CPU. - Контейнеризация. - Работа с Jenkins. - Использование векторных баз и эмбеддингов для RAG. - Реализация function calling. - Работа с KServe. - Применение BERT-подобных моделей. - Работа с эвристиками. - Опыт квантизации LLM. Требования: - Понимание принципов проектирования AI-агентов: управление состоянием и контекстом, выбор инструментов, контроль уровня автономности и human-in-the-loop. - Глубокое понимание основных принципов машинного обучения: подготовка данных и признаков, выбор моделей, регуляризация, переобучение, data leakage, интерпретация результатов. - Знание математической статистики: проверка гипотез, доверительные интервалы, дизайн и анализ A/B-тестов. - Понимание принципов оценки качества ML-систем: offline- и online-метрики, построение валидации, оценка бизнес-эффекта, мониторинг качества моделей и данных. - Опыт работы хотя бы в одном из направлений: классическое машинное обучение; временные ряды и прогнозирование; рекомендательные системы, поиск и ранжирование; NLP, LLM и генеративный AI. - Уверенное владение Python и основными библиотеками для анализа данных и машинного обучения: pandas или polars, NumPy, scikit-learn, CatBoost / LightGBM / XGBoost, PyTorch или аналогичные инструменты. - Умение писать поддерживаемый production-код: модульная архитектура, тестирование, логирование, документация, работа с Git и участие в code review. - Уверенное владение SQL. - Опыт построения evals для LLM-систем, оценки качества ответов, контроля галлюцинаций и мониторинга поведения системы. - Понимание рисков prompt injection, некорректного tool calling, утечки данных и чрезмерных прав доступа агента. - Опыт работы с API языковых моделей, Hugging Face и одним из orchestration-фреймворков. - Умение оценивать стоимость, latency и масштабируемость LLM-решений. - Опыт работы в e-commerce, retail или других продуктовых highload-системах. - Опыт работы с Airflow, MLflow, Kafka, Redis, Kubernetes, Prometheus и Grafana. - Опыт эксплуатации GPU-инфраструктуры и оптимизации inference. - Опыт fine-tuning или адаптации LLM, включая LoRA / PEFT. - Опыт проектирования agentic workflows или multi-agent-систем. - Понимание принципов информационной безопасности, privacy и работы с персональными данными.
Middle DevOps-инженер
На проект- Формат
- Удалённо
- Страна
- Россия
- Город
- Москва
- Грейд
- Middle
Компания PlaysDev — аккредитованная аутстафф-компания, специализирующаяся на DevOps-инженерах. За плечами 350+ реализованных проектов, в штате более 60 DevOps-специалистов. Развивает внутреннее экспертное сообщество и делает ставку на долгосрочное сотрудничество с сотрудниками. Важна не столько проектная занятость, сколько стабильность и возможность профессионального роста внутри компании. Обязанности: - Разработка и поддержка CI/CD пайплайнов (GitLab CI) для автоматизации сборки, тестирования и развертывания приложений. - Автоматизация инфраструктуры через Infrastructure as Code (Terraform, Ansible). - Развертывание и сопровождение Kubernetes-кластеров (создание Helm-чартов, настройка Ingress/Traefik). - Настройка систем мониторинга, логирования и алертинга (Prometheus, Grafana, VictoriaMetrics). - Обеспечение отказоустойчивости, масштабируемости и безопасности сервисов. - Оптимизация облачной инфраструктуры и контроль затрат. - Поддержка production-среды, участие в расследовании инцидентов. - Взаимодействие с командами разработки для внедрения лучших DevOps-практик. Требования: - Опыт работы в DevOps/SRE от 3+ лет. - Уверенное знание Linux (администрирование, настройка, диагностика) — обязателен опыт с RedOS и/или Astra. - Практический опыт с контейнеризацией (Docker) и оркестрацией (Kubernetes: Helm, Ingress, Traefik). - Построение CI/CD (предпочтительно GitLab CI, опыт с Jenkins/GitHub Actions — тоже плюс). - Infrastructure as Code (Terraform, Ansible). - Опыт работы с облачными платформами (Yandex Cloud, VK Cloud, AWS). - Мониторинг и логирование (Prometheus, Grafana, VictoriaMetrics). - Конфигурирование БД (SQL/NoSQL): Postgres, Redis, Tarantool, Qdrant (хотя бы одна). - Владение скриптовыми языками (Bash, Python) для автоматизации задач. - Понимание сетевых протоколов (TCP/IP, HTTP, DNS) и принципов работы ОС. Будет плюсом: - Опыт с GitOps (ArgoCD) и управлением конфигурациями. - Работа с системами хранения секретов (HashiCorp Vault). - Навыки DevSecOps.
Software Engineer, Platform Productivity
- Формат
- Удалённо
- Страна
- Ирландия
- Город
- Не указан
Grafana Labs — компания, создавшая Grafana Cloud, управляемую платформу наблюдаемости, которой доверяют более 10 000 организаций для обеспечения надёжности, ускорения инцидент-менеджмента и оптимизации телеметрии в масштабе. Платформа построена на открытом исходном коде и открытых стандартах, разработана для совместимости с любым стеком. Grafana Cloud объединяет ИИ и наблюдаемость, предоставляя командам единое представление о данных. Среди клиентов — Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce. Компания полностью удалённая, команда работает в более чем 40 странах. Инвесторы: Lightspeed Venture Partners, Sequoia Capital, GIC, Coatue, J.P. Morgan, CapitalG и Lead Edge Capital. Вакансия открыта для кандидатов, проживающих в часовых поясах Ирландии. Роль: Software Engineer — Platform Productivity. Grafana Cloud обрабатывает миллионы метрик, логов и трейсов в секунду из окружений клиентов, обеспечивая высокую доступность и низкую задержку. Цель — рост до сотен миллионов в секунду с одновременным улучшением производительности и надёжности. Внутренняя инженерная платформа, предоставляемая департаментом Platform, даёт инженерам приложений инструменты, системы и Kubernetes-кластеры для сборки, развёртывания и запуска рабочих нагрузок. Платформенные роли ориентированы на инженеров с интересом к производительности и надёжности, которые любят вести проекты от идеи до продакшена. Команды организованы в сквады: облачная инфраструктура, сети и безопасность; инженерная продуктивность; управление ёмкостью; клиентский административный инструментарий; соответствие требованиям US Federal. Из-за продакшен-сервисов есть дежурства для поддержания здоровья системы. Все сотрудники используют продуктовую линейку компании в повседневной работе, дежурства помогают понять систему и то, как люди пользуются продуктами. Обязанности сквада Platform Productivity: - Помощь внутренним инженерам в выпуске ПО на инфраструктуру безопасными и измеримыми способами. - Автоматизация процессов релиза — от CI/CD до бутстрапинга. - Внедрение «золотых путей» для внутренних инженерных команд, поддержка крайних случаев и максимально эффективное использование инструментов. - Установка собственного роадмапа сквада, участие в выборе приоритетов и своевременном выводе из эксплуатации устаревших систем. - Разработка и поддержка внутренней инженерной платформы (IEP). - Управление и развитие CI/CD-платформы. - Автоматизация сборки, релиза и развёртывания. - Инструментарий управления конфигурацией приложений. - Автоматизация обновления ПО. - Управление артефактами. - Работа с разными внутренними командами — от разработки приложений до безопасности — для реализации их требований. - Участие в дежурствах для поддержки платформенных инструментов. Условия: - Полная удалённая работа. - Доступ к современным ИИ-ассистентам для программирования в ежедневном рабочем процессе — выбор инструментов в рамках политики безопасности, с оплачиваемым компанией бюджетом использования. - Поощряется прагматичная ИИ-ассистированная разработка: быстрое прототипирование, генерация тестов, рефакторинг, документация и разбор инцидентов — при строгих стандартах код-ревью и качества. - Доступ к последним frontier-моделям от OpenAI и Anthropic.
Software Engineer, Platform Productivity
- Формат
- Удалённо
- Страна
- Великобритания
- Город
- Не указан
Grafana Labs — компания, создавшая Grafana Cloud, управляемую платформу наблюдаемости, которой доверяют более 10 000 организаций для обеспечения надежности, ускорения устранения инцидентов и оптимизации телеметрии в масштабе. Платформа построена на открытом исходном коде и открытых стандартах, предназначена для совместимости с любым стеком. Клиенты, включая Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce, полагаются на Grafana Labs. Компания полностью удаленная, команда распределена по более чем 40 странам. Роль: Software Engineer - Platform Productivity. Grafana Cloud обрабатывает миллионы метрик, строк логов и трейсов в секунду из окружений клиентов, обеспечивая высокую доступность и низкую задержку. Цель — рост до сотен миллионов в секунду с одновременным улучшением производительности и надежности. Внутренняя инженерная платформа, создаваемая департаментом Platform, предоставляет инженерам приложений инструменты, системы и Kubernetes-кластеры для сборки, развертывания и запуска их рабочих нагрузок. Роли в платформе ориентированы на инженеров с интересом к производительности и надежности, которые любят доводить проекты от идеи до продакшена. Команды организованы в сквады, охватывающие облачную инфраструктуру, сети и безопасность, инженерную продуктивность, управление мощностями, клиентские административные инструменты и соответствие требованиям федерального правительства США. Из-за работы с продакшен-сервисами предусмотрены дежурства для обеспечения здоровья системы. Обязанности в скваде Platform Productivity: - Помощь внутренним инженерам в выпуске программного обеспечения на инфраструктуру безопасными и измеримыми способами. - Автоматизация процессов релиза — от CI/CD до начальной настройки окружений. - Внедрение «золотых путей» для внутренних команд и поддержка нестандартных случаев. - Поддержка, улучшение и расширение существующих систем. - Участие в выборе направлений развития и своевременном выводе устаревших систем. - Разработка и сопровождение внутренней инженерной платформы. - Управление и развитие CI/CD. - Автоматизация сборки, релиза и развертывания. - Инструменты управления конфигурацией приложений. - Автоматизация обновления программного обеспечения. - Управление артефактами. - Взаимодействие с внутренними командами — от разработки приложений до безопасности — для реализации их требований. - Участие в дежурствах для поддержки инструментов платформы. Компания инвестирует в продуктивность разработчиков. Разрешено использование современных ИИ-ассистентов для написания кода в рамках ежедневного рабочего процесса с выбором инструментов в пределах политик безопасности и оплачиваемым бюджетом. Поощряется прагматичная ИИ-разработка: ускоренное прототипирование, генерация тестов, рефакторинг, документация и разбор инцидентов — при строгих стандартах код-ревью и качества. Предоставляется доступ к последним моделям от OpenAI и Anthropic. Это удаленная позиция, рассматриваются кандидаты, проживающие в часовых поясах Великобритании.
Software Engineer, Platform Productivity
- Формат
- Удалённо
- Страна
- Испания
- Город
- Не указан
Grafana Labs — компания, стоящая за Grafana Cloud, управляемой платформой наблюдаемости, которой доверяют более 10 000 организаций для обеспечения надежности, быстрого устранения инцидентов и оптимизации телеметрии в масштабе. Платформа построена на открытом исходном коде и открытых стандартах, предназначена для взаимодействия с любым стеком. Клиенты, включая Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce, полагаются на Grafana Labs. Это полностью удаленная компания с сотрудниками в более чем 40 странах. Платформа Grafana Cloud обрабатывает миллионы метрик, лог-строк и трейсов в секунду из окружений клиентов, обеспечивая высокую доступность и низкую задержку. Цель — рост до сотен миллионов в секунду с улучшением производительности и надежности. Внутренняя инженерная платформа, создаваемая департаментом Platform, предоставляет прикладным инженерам инструменты, системы и Kubernetes-кластеры для сборки, развертывания и запуска рабочих нагрузок. Команда Platform Productivity отвечает за помощь внутренним инженерам в выпуске программного обеспечения на инфраструктуру безопасными и измеримыми способами. Задачи включают автоматизацию процессов релиза (от CI/CD до бутстраппинга), внедрение «золотых путей» и поддержку краевых случаев. Команда самостоятельно определяет дорожную карту, включая выбор направлений и вывод устаревших систем из эксплуатации. Обязанности: - Разработка и поддержка внутренней инженерной платформы (IEP) - Управление и развитие CI/CD платформы - Автоматизация сборки, релиза и развертывания - Инструменты управления конфигурацией приложений - Автоматизация обновления программного обеспечения - Управление артефактами - Взаимодействие с внутренними командами, от разработки приложений до безопасности, для реализации их требований - Участие в on-call ротации для поддержки инструментов платформы Условия: - Полная удаленная работа, рассматриваются кандидаты в часовых поясах Испании - Доступ к современным AI-ассистентам для кодирования в рамках ежедневного рабочего процесса, с корпоративным бюджетом на использование - Доступ к последним моделям от OpenAI и Anthropic
DevOps-инженер-стажёр, Nix и Rust
- Формат
- Офис
- Страна
- Не указана
- Город
- Не указан
- Грейд
- Стажировка
atvari — технологическая компания, специализирующаяся на архитектуре программного обеспечения и облачных решений, разработке ПО, облачном инжиниринге, DevOps и ИТ-консалтинге. Команда делает акцент на Rust, Nix и открытых технологиях, ценит чистый поддерживаемый код и совместную инженерную практику. В компании поощряется обучение, эксперименты и вклад в open-source сообщество. Задачи Поддержка проектирования, внедрения и сопровождения сред разработки и развертывания на базе Nix. Написание и доработка конфигураций Nix и NixOS. Автоматизация процессов сборки и развертывания. Интеграция Nix с существующими программными проектами. Совместная работа с инженерами над бэкенд-сервисами. Устранение проблем окружения и зависимостей. Документирование конфигураций и инструментов. Условия Полностью удаленная стажировка. Неоплачиваемая, продолжительностью 1–3 месяца по вашим потребностям. Доступна как добровольная (Freiwilliges Praktikum) или обязательная (Pflichtpraktikum) стажировка. Только для резидентов Германии. Вы подходите, если у вас нет завершенного обучения или университетского диплома (добровольная стажировка) или вам нужна обязательная стажировка в рамках учебной программы (обязательная стажировка). Требования Уверенные базовые знания в области компьютерных наук: алгоритмы, структуры данных, операционные системы. Опыт разработки как минимум на одном языке высокого уровня (знание Rust — плюс). Понимание концепций бэкенд-разработки: API, микросервисы, серверные фреймворки. Знакомство с принципами функционального программирования и их применением в кодовой базе. Интерес к Nix / NixOS, воспроизводимым сборкам, DevOps и инфраструктуре как коду. Способность быстро учиться, работать в команде и ясно излагать технические темы. Комфортная работа удаленно в Германии и взаимодействие в кросс-функциональной инженерной среде. Технологический стек Nix / NixOS Rust TypeScript и React Kubernetes и Podman OpenTofu / Terraform gRPC, Protobuf и buf GraphQL Grafana, Loki, Tempo, Mimir OpenTelemetry WebAssembly OpenCode и Claude Code GitHub, GitLab, Forgejo Hetzner Cloud, GCP, AWS, Azure, OpenStack Прочие инструменты Proton Workspace (Proton Mail, Proton Calendar, Proton Drive, Proton Pass, Proton Meet, Proton Lumo AI) Element / Matrix
Стажёр Rust-инженер
- Формат
- Офис
- Страна
- Не указана
- Город
- Не указан
- Грейд
- Стажировка
atvari — технологическая компания, специализирующаяся на архитектуре ПО и облачных решений, заказной разработке, облачном инжиниринге, DevOps и ИТ-консалтинге. Команда делает акцент на Rust, Nix и открытых технологиях, ценит чистый поддерживаемый код и совместную инженерную практику. Задачи - Поддержка проектирования, реализации и сопровождения Rust-проектов. - Помощь в написании и доработке конфигураций Nix и NixOS. - Автоматизация процессов сборки и развёртывания. - Интеграция Nix с существующими проектами. - Совместная работа с инженерами над бэкенд-сервисами. - Диагностика проблем окружения и зависимостей. - Документирование конфигураций и инструментов. Условия - Полностью удалённая стажировка. - Без оплаты, продолжительность 1–3 месяца по вашим потребностям. - Доступна как добровольная (Freiwilliges Praktikum) или обязательная (Pflichtpraktikum) стажировка. - Только для резидентов Германии. - Подходит, если у вас нет завершённого обучения или высшего образования (добровольная стажировка) или стажировка обязательна в рамках учебной программы (обязательная стажировка). Требования - Сильные базовые знания в Computer Science: алгоритмы, структуры данных, операционные системы. - Опыт разработки как минимум на одном языке высокого уровня (опыт с Rust — плюс). - Понимание концепций бэкенд-разработки: API, микросервисы, серверные фреймворки. - Знакомство с принципами функционального программирования и их применением. - Интерес к Nix / NixOS, воспроизводимым сборкам, DevOps и инфраструктуре как коду. - Способность быстро учиться, работать в команде и ясно излагать технические темы. - Комфортная удалённая работа в Германии и взаимодействие в кросс-функциональной среде. Технологический стек - Nix / NixOS - Rust - TypeScript и React - Kubernetes и Podman - OpenTofu / Terraform - gRPC, Protobuf и buf - GraphQL - Grafana, Loki, Tempo, Mimir - OpenTelemetry - WebAssembly - OpenCode и Claude Code - GitHub, GitLab, Forgejo - Hetzner Cloud, GCP, AWS, Azure, OpenStack Прочие инструменты - Proton Workspace (Proton Mail, Proton Calendar, Proton Drive, Proton Pass, Proton Meet, Proton Lumo AI) - Element / Matrix
Backend-инженер Platform, Stacks
- Формат
- Офис
- Страна
- Великобритания, Германия, Ирландия, Испания, Швеция
- Город
- Не указан
Grafana Labs — компания, развивающая Grafana Cloud, управляемую платформу наблюдаемости, которой доверяют более 10 000 организаций. Платформа построена на открытых стандартах и предназначена для обеспечения надежности, ускорения инцидент-менеджмента и оптимизации телеметрии в масштабе. Среди клиентов — Anthropic, Bloomberg, NVIDIA, Microsoft и Salesforce. Компания полностью удаленная, команда распределена по более чем 40 странам. Роль доступна для кандидатов в Великобритании, Германии, Испании, Ирландии и Швеции. Группа Application Core Services (AppCore) входит в отдел Platform подразделения Foundations. Foundations создает внутреннюю инженерную платформу (IEP) и тесно сотрудничает с командами Cloud, Enterprise и Grafana. Команда разрабатывает системы, обеспечивающие бизнес-операции Grafana, используя платформу grafana.com для создания интеграций и решений, объединяющих техническую экосистему компании. AppCore состоит из нескольких сквадов, каждый из которых отвечает за одну или несколько доменных областей. Работа включает поддержку биллинговой системы для расчета потребления, автоматизацию provisioning после подписания контракта, интеграцию с облачными маркетплейсами AWS, Azure и GCP, а также разработку пользовательского портала для управления аккаунтами. Сквад AppCore Stacks владеет системами, которые создают, настраивают, согласовывают, мигрируют и эксплуатируют стеки Grafana Cloud в масштабе. Стек — это пользовательская среда Grafana Cloud, связывающая организацию с Grafana и бэкенд-сервисами, включая Mimir, Loki, Tempo, плагины, дашборды, источники данных и конфигурацию уровня стека. Команда строит сервисы control-plane и рабочие процессы, поддерживающие согласованность состояния стека между grafana.com, Stack State Service (SSS), Hosted Grafana, облачными регионами и инфраструктурой Grafana Cloud. Задачи: - Проектирование, разработка и эксплуатация систем согласования, включая бэкенд SSS, для отслеживания желаемого состояния стека, обнаружения и устранения расхождений между шаблонами стека, состоянием grafana.com, Hosted Grafana и фактической конфигурацией клиентского стека. - Взаимодействие с командами SSS, grafana.com и конфигураций развертывания для обеспечения надежности, наблюдаемости и устойчивости рабочих процессов жизненного цикла стека. - Повышение операционной эффективности за счет снижения сложности развертывания (например, стремление к развертыванию SSS в регионе через один PR) и участие в проекте Stack Config Reconciliation. - Управление механизмами раскатки для предоставляемых плагинов, дашбордов, источников данных, версий Grafana, каналов релизов и конфигурации уровня стека. - Поддержка запуска новых регионов и кластеров, включая операционные пути для безопасного ввода стеков в эксплуатацию в новых регионах Grafana Cloud. - Улучшение процессов реагирования на инциденты и восстановления при рассинхронизации стека, сбоях согласования и проблемах с раскаткой плагинов. Инженеры Grafana могут вносить вклад в open-source сообщества и сотрудничать с командами за пределами своей непосредственной зоны ответственности.
Ведущий Go-разработчик, S3 и Kubernetes
- Формат
- Офис
- Страна
- Россия
- Город
- Не указан
- Грейд
- Lead
Cloud X — ИТ-компания, предоставляющая услуги облачных вычислений на базе собственной инфраструктуры: облачной платформы CX Platform и гипермасштабируемых центров обработки данных CX Data Centers с нулевым углеродным следом. Компания предлагает более 40 сервисов, предоставляемых по моделям IaaS, PaaS и SaaS, среди которых: базовая инфраструктура, ИИ, машинное обучение, интеграционные сервисы, Интернет вещей, большие данные, сетевые функции и кибербезопасность. Облако Cloud X внесено в реестр отечественного программного обеспечения Министерства цифрового развития, связи и массовых коммуникаций Российской Федерации. Инвестором компании выступает Эн+. Обязанности - Разработка высоконагруженных сервисов (Go, Kubernetes) для S3-совместимого объектного хранилища, в том числе проектирование и разработка слоев web, метаданных, балансировки, хранения; - Проектирование и разработка решений по обеспечению строгой консистентности в распределенных системах и оптимизация latency / throughput; - Написание юнит и интеграционных тестов; - Участие в спринтах, планированиях, ретроспективах, код ревью; - Оптимизация текущих решений в контексте отказоустойчивости, масштабирования и производительности. Требования - Коммерческий опыт разработки на Golang от 5 лет. Хорошее понимание возможностей языка (понимание планировщика, горутин, модели памяти); - Опыт проектирования и разработки многопоточных, отказоустойчивых, масштабируемых приложений. Глубокое понимание принципов DDD, Clean Architecture, SOLID; - Опыт работы с реляционными СУБД (PostgreSQL, MySQL или др); - Опыт работы с колоночными СУБД (Clickhouse) и распределенными NoSQL СУБД; - Опыт работы с брокерами сообщений (Kafka, RMQ); - Опыт работы с Linux и средствами контейнеризации (Docker, Kubernetes) на уровне разработчика приложений; - Опыт работы с системами сбора и обработки журналов аудита (ELK / Graylog / Grafana Loki / Monq). Знакомство с OpenTelemetry или OpenTracing; - Опыт оптимизации производительности приложений на Go: навыки профилирования (pprof) и оптимизации аллокаций, опыт работы с высокоскоростной сериализацией (Protobuf); - Уверенное знание сетевого стека: net, глубокое понимание HTTP / 2, gRPC. Будет существенным плюсом - Практический опыт с решениями S3 – на базе Ceph RGW (RADOS Gateway) или MinIO, понимание архитектуры S3 API (Bucket, Object, Multipart Upload, ACL / Policies); - Опыт разработки Kubernetes Operators на Go; - Работа с eBPF для сетевого мониторинга или ускорения трафика.
Курсы и материалы для изучения Grafana
Задачам, для которых этот инструмент прямо указан в требованиях вакансии.
Требования к версии, доступу и инфраструктуре зависят от проекта.
Возможности
Что можно использовать в работе
- Дашборды
- Источники данных
- Оповещения