SRE-инженер по автоматизации и наблюдаемости
ЗарплатаПо договорённости
ФорматОфис
ЛокацияНе указана
О проекте
Поиском Яндекса пользуются сотни миллионов пользователей, сотни тысяч ядер обрабатывают миллиарды запросов в сутки, а некоторые микросервисы держат десятки миллионов RPS, обрабатывая петабайты горячих данных. Команда работает над всей инфраструктурой основного веб-поиска и поиска по картинкам. Ищем SRE, способных внедрять современные SRE-подходы и процессы.
Задачи
- Автоматизация непрерывной поставки: разрабатывать и улучшать механизмы автоматической приёмки и выкатки релизов, минимизируя участие сервисных команд. Это позволит одновременно повысить надёжность и оптимизировать время вывода изменений.
- Разработка инструментов наблюдаемости: использовать и развивать специфичные инструменты для обеспечения наблюдаемости на всех стадиях: распределённый трейсинг, инструментарий для анализа инцидентов и так далее.
- Улучшение процессов координации инцидентов: с появлением LLM автоматизировать и упрощать значительную часть координации инцидентов, улучшать процессы починки аварий, упрощать дебаг сложных инцидентов и ускорять починку.
Требования
- Опыт работы с системами мониторинга и управления конфигурациями.
- Уверенное владение Linux, крепкая ментальная модель разных подсистем.
- Понимание принципов работы TCP/IP и умение диагностировать сетевые проблемы.
- Понимание построения распределённых и отказоустойчивых веб-сервисов.
- Знакомство с подходами «инфраструктура как код».
- Хорошее владение Python или Go.
Условия
- Ежегодные медицинские чекапы, йога и психотерапия.
- Формат работы: офис.
- Зарплата по договорённости.
Инструменты в вакансии
Навыки и технологии
Направления