О компании
Blue Orange Digital — бутиковая data и AI консалтинговая компания, которая проектирует и создает современные платформы данных, аналитику и ML/AI-решения для клиентов среднего и крупного бизнеса в сферах Private Equity, финансовых услуг, здравоохранения и ритейла. Команды работают с технологиями Databricks, Snowflake, dbt и экосистемой Microsoft, превращая сложные реальные данные в надежные и применимые инсайты. Культура компании — builder-led, client-first: ценятся ответственность, четкая коммуникация и доведение работы до результата.
О позиции
Полная занятость, 6-месячный встроенный проект в среде данных private capital. Роль объединяет две части: примерно половина — старшая инженерия данных (Snowflake, dbt, Airflow, AWS, Python-загрузка данных), половина — старшая LLM/агентная инженерия (продакшн-агенты, MCP-серверы, практика оценки, наблюдаемость). Два ключевых направления работы: AI-Ready каталог данных и контекстный слой, создаваемый вместе с командой Data Analytics, и извлечение неструктурированных данных в масштабе. Сквозная тема обеих инициатив — агентная реализация, оценка и оркестрация. Это не роль по поддержке пайплайнов: нужен человек, который уже выводил агентов в продакшн и может честно рассказать, что ломалось.
Задачи
Агентная разработка (основной фокус):
- Создание продакшн-агентов и многошаговых агентных процессов.
- Проектирование и реализация MCP-серверов и интерфейсов инструментов как основного слоя интеграции между агентами и платформой данных, включая кастомные внутренние MCP-серверы над проприетарными наборами данных.
- Архитектурные решения: агент против детерминированного пайплайна, один агент против нескольких, места для human-in-the-loop проверок.
Оценка и наблюдаемость агентов:
- Создание практики оценки с нуля: eval-датасеты, LLM-as-judge, регрессионное тестирование.
- Определение и отслеживание метрик: success rate, faithfulness, точность извлечения, корректность вызовов инструментов, задержка, стоимость запуска.
- Инструментирование трассировки и наблюдаемости агентных запусков.
Агентская оркестрация:
- Управление агентными нагрузками в Airflow 3.x на Astronomer: LLM и агентные вызовы как именованные, независимо повторяемые задачи; dynamic task mapping для fan-out/fan-in; assets и data-aware scheduling для событийных триггеров; deferrable operators для длительных вызовов; human-in-the-loop операторы для согласований.
- Проектирование нагрузок, которые не должны жить в DAG: длительные или интерактивные агенты на AWS ECS/Fargate, очередь и событийно-управляемое выполнение, API-триггерные сервисы. Четкое объяснение границы оркестрации и причин такого разделения.
AI-Ready каталог и семантический контекст:
- Моделирование семантических определений поверх Snowflake и dbt: метрики, связи сущностей, бизнес-глоссарий, владельцы данных — чтобы агенты получали управляемый смысл, а не сырые имена таблиц.
- Создание и поддержка Snowflake Semantic Views и семантических моделей Cortex Analyst, синхронизация с dbt как источником истины.
- Настройка версионирования, тестирования и продвижения контекста.
Метаданные и управление:
- Сбор lineage, freshness, описаний на уровне колонок, классификации, тегов чувствительности и сигналов использования.
- Автоматизация генерации описаний и тегов с помощью LLM там, где это безопасно, с обязательным человеческим контролем.
- Оценка инструментов каталога и метаданных, подготовка рекомендации build-vs-buy.
Извлечение неструктурированных данных:
- Проектирование пайплайнов извлечения из PDF, презентаций, таблиц, email и веб-контента, включая документы со сложной структурой и вложенными таблицами.
- Схемно-ограниченное извлечение через structured outputs и tool calling с frontier LLM API и Cortex LLM functions, с confidence scoring, ссылками на исходную страницу и явной обработкой полей с низкой уверенностью.
- Реализация стратегий chunking, embedding и retrieval для RAG и агентного поиска.
- Проектирование цикла человеческой проверки: что принимается автоматически, что эскалируется, как исправления возвращаются в eval-датасеты.
Старшая инженерия данных и архитектура:
- Определение и реализация архитектурных решений для скорости и масштабируемости пайплайнов, включая tiered/medallion-структуры.
- Внедрение лучших практик продвинутого ELT, управления данными и качества данных.
- Определение и контроль политик безопасности данных и контроля доступа на пайплайнах и платформах.
- Создание и поддержка Python-пайплайнов загрузки (dlt и аналоги) для REST API, SaaS-коннекторов, файловых загрузок и инкрементальной загрузки в Snowflake.
- Участие в моделях dbt, тестах и документации.
Требования
- Глубинная экспертиза в агентных системах.
- Опыт вывода агентов в продакшн и способность честно рассказать о возникших проблемах.
- Опыт старшей инженерии данных: Snowflake, dbt, Airflow, AWS, Python-загрузка данных.
Условия
- Полная занятость.
- 6-месячный встроенный проект в среде данных private capital.