О компании
LivePerson — компания в сфере корпоративного разговорного ИИ и цифровой трансформации.
О роли
Senior Software Engineer в распределённой команде Data Platform в Европе. Роль предполагает модернизацию core data platform: миграцию mission-critical пайплайнов данных с легаси Hadoop, Spark и Impala на облачную архитектуру Databricks. Также нужно вести технические решения и влиять на архитектуру платформы.
Задачи
- Миграция пайплайнов данных с Hadoop, Spark и Impala на Databricks: реархитектура ETL-процессов, конвертация сложного SQL, миграция интеграций, соединений и секретов.
- Использование AI-ассистентов (Claude, Codex) для ускорения миграции: конвертация SQL, модернизация ETL-скриптов, генерация чистого поддерживаемого кода, проверка архитектуры, производительности и качества.
- Проектирование и оптимизация масштабируемых пайплайнов данных с использованием Airflow и Databricks.
- Обеспечение качества данных: внедрение стратегий валидации и тестирования для точности и согласованности мигрированных данных.
- Повышение надёжности платформы: улучшение observability, мониторинга и практик реагирования на инциденты, участие в on-call ротации для поддержки production-систем.
- Применение знаний аналитики контакт-центров для создания платформ, обеспечивающих аналитику разговоров, отчётность и бизнес-аналитику.
Требования
- 6–8 лет опыта разработки и поддержки распределённых систем и крупномасштабных платформ данных.
- Опыт руководства или ключевого участия в миграции корпоративных платформ данных с легаси-технологий (Hadoop, Spark, Hive, Impala) на современные облачные решения (Databricks).
- Глубокие знания экосистемы Databricks: Jobs, Delta Lake, конфигурация и оптимизация кластеров, миграция сложных SQL-нагрузок с Impala или Hive на Spark SQL.
- Продвинутые навыки Python для ETL-разработки, опыт проектирования, отладки и оптимизации production-пайплайнов и оркестрации с Airflow и Databricks.
- Опыт работы с облачными платформами, особенно Google Cloud Platform (GCP) и Google Cloud Storage (GCS), понимание контейнеризированных Kubernetes-based (GKE) микросервисных архитектур.
- Понимание распределённой обработки данных и компромиссов между real-time и batch-обработкой.
- Опыт работы с легаси big data технологиями, включая Hadoop и MapReduce.
- Знание паттернов интеграции данных: API, коннекторы, webhooks, event-driven архитектуры.
Условия
- Локация: Берлин, Германия.
- Полностью удалённая работа (Fully Remote).