О компании
ClickHouse — компания из списка Forbes Cloud 100 2025 года. Более 4 000 клиентов, годовой рост ARR более 250%. Лидер рынка в области аналитики реального времени, хранилищ данных, наблюдаемости и AI-нагрузок. Привлекла $400 млн в раунде Series D. Среди клиентов — Capital One, Lovable, Decagon, Polymarket, Airwallex, а также Meta, Cursor, Sony, Tesla.
Команда Connectors занимается интеграциями: плагины визуализации (Tableau, PowerBI, Superset, Metabase), коннекторы для фреймворков данных (Apache Spark, Flink, Kafka Connect, Fivetran), оркестрации и AI-инструментов. Работа влияет на обработку больших данных: аналитика реального времени, наблюдаемость, AI-приложения.
О роли
Senior Software Engineer, специализация — AI/ML экосистема. Ключевой участник, отвечающий за развитие AI-экосистемы ClickHouse. Роль находится на стыке высокопроизводительной инженерии баз данных и разработчикового опыта. Нужен опыт работы AI/ML-инженером или дата-сайентистом. Базы данных становятся векторными хранилищами для RAG, бэкендами для LLM-агентов и фиче-сторами для ML-инференса. Ответственность за полный жизненный цикл ключевых AI/ML-интеграций: LangChain, LlamaIndex, n8n, а также более широкие AI-инструменты: пайплайны эмбеддингов, RAG с ClickHouse как векторным хранилищем, ML-фиче-сторы, LLM-приложения.
Задачи
- Развивать Python-коннектор и SDK-экосистему ClickHouse: производительность, надёжность, дизайн API.
- Формировать стратегию AI/LLM-интеграций: коннекторы и паттерны для RAG-архитектур, ML-фиче-пайплайнов и LLM-приложений.
- Активно работать с open-source сообществом: разбирать issues, поддерживать контрибьюторов, защищать интересы пользователей, формировать roadmap.
- Сотрудничать с командами Product, Cloud и другими инженерными командами.
- Привносить практический взгляд в решения по roadmap, опираясь на реальные рабочие процессы дата-инженеров и дата-сайентистов.
Требования
- 7+ лет опыта разработки ПО, включая практическую работу дата-сайентистом или ML-инженером.
- Глубокий опыт проектирования и поддержки продакшн-готовых Python-коннекторов, SDK или интеграций для как минимум одной крупной платформы (оркестрация, BI, MLOps или трансформация данных).
- Практический опыт применения AI/ML в продакшн-контексте дата-инженерии: генерация эмбеддингов, векторный поиск, фиче-пайплайны или LLM-инструменты, которые были запущены и работали в продакшене.
- Уверенный опыт с Python-экосистемой данных: Pandas, NumPy, Pydantic и смежные библиотеки.
- Сильные знания баз данных: SQL, моделирование данных, оптимизация запросов, знакомство с OLAP/аналитическими базами данных.
- Уверенный опыт с конкурентным Python: threading, multiprocessing, async-паттерны.
- Отличные письменные и устные коммуникативные навыки.