О компании
Sonatype — компания в сфере управления цепочками поставок программного обеспечения. Она управляет Maven Central — крупнейшим в мире репозиторием Java-компонентов с открытым исходным кодом. Платформу Sonatype используют более 2000 организаций, включая 70% компаний из Fortune 100, и более 15 миллионов разработчиков.
Роль
Ищем Data Scientist в растущую команду AI и Data Science. Вы будете работать как внутренний ИИ-консультант и технический лидер, помогая командам Sonatype применять машинное обучение и генеративный ИИ: от обнаружения вредоносного поведения и аномалий в данных безопасности до GenAI-решений для разработчиков и аналитиков. Вы будете исследовать сложные наборы данных, проектировать эксперименты, строить и валидировать модели, тесно сотрудничать с командами продукта, инженерии и безопасности, превращая исследовательские идеи в практические масштабируемые решения. У нас зрелая команда инженерии данных, поэтому вы сможете сосредоточиться на построении и запуске моделей. Роль подходит тому, кто комфортно работает с автономией, любит превращать неоднозначные идеи в работающие системы и предпочитает работать на стыке направлений.
Что вы будете делать
- Вести прикладные AI-проекты от концепции до результата: прототипирование, валидация, помощь командам во внедрении практических ML и GenAI-решений.
- Выступать внутренним консультантом для команд продукта, инженерии, безопасности и исследований: определять задачи, оценивать подходы, давать рекомендации по лучшим практикам ML/AI и продуктивному использованию генеративных технологий.
- Руководить исследованиями, разработкой и внедрением моделей для таких задач, как обнаружение вредоносного поведения, аномалий и мошенничества — с использованием методов от классического ML до LLM, эмбеддингов, retrieval-augmented generation и агентных рабочих процессов.
- Проектировать надёжные эксперименты и создавать пайплайны оценки надёжности, точности и бизнес-эффекта моделей (кросс-валидация, мониторинг дрейфа, оценка на эталонных данных).
- Соединять исследования и продакшн: превращать исследовательские результаты в масштабируемые API, инструменты или рабочие процессы, позволяющие другим командам эффективно применять AI.
- Исследовать новые техники (LLM, эмбеддинг-модели, RAG, агентные рабочие процессы) для улучшения опыта разработчиков и специалистов по безопасности.
- Понятно доносить технические концепции, компромиссы и рекомендации до технических и нетехнических заинтересованных сторон через презентации, документацию и совместную работу; наставлять коллег и повышать AI-грамотность организации.
- Сотрудничать с командой управления данными для соблюдения нормативных требований по конфиденциальности данных и этических соображений при работе с данными клиентов.
Что мы ждём
- 5+ лет практического опыта в прикладной науке о данных, машинном обучении, AI-инженерии или AI-исследованиях.
- Степень в области компьютерных наук или эквивалентную техническую степень (желательно).
- Уверенные навыки Python и практический опыт работы с библиотеками и платформами для данных и AI: Databricks, LLM API, scikit-learn.
- Опыт создания и запуска ML или GenAI-приложений — от раннего прототипа до рабочего внутреннего или клиентского процесса.
- Глубокое знакомство с современными LLM-экосистемами: OpenAI, Anthropic/Claude, Hugging Face, модели с открытыми весами.
- Умение выбирать модели и проектировать эффективные LLM-приложения с использованием промптинга, управления контекстом, структурированных выходов, поиска и использования инструментов.
- Опыт создания агентных или многошаговых AI-рабочих процессов с LangGraph, LangChain, Semantic Kernel или аналогичными фреймворками оркестрации.
- Сильное аналитическое мышление: определение полезных метрик качества, создание репрезентативных оценочных датасетов, оценка надёжности и принятие решений на основе данных.
- Комфортная работа с большими, «грязными», структурированными и неструктурированными данными для создания признаков, инсайтов и понятных визуализаций.
- Владение Git, тестированием, код-ревью и совместными практиками разработки ПО.
- Практичный и взвешенный подход: интерес к новым возможностям AI при создании поддерживаемых, безопасных и надёжных систем.
- Проактивность и ответственность, сильные письменные и устные коммуникативные навыки для работы с техническими и нетехническими специалистами.