Назад к вакансиям
Дата обнаружения: 31 августа 2026 г.

Data Scientist, ML и генеративный ИИ

Sonatype

ЗарплатаПо договорённости
Страна
Канада
Город
Не указан
Формат
Офис
Направления
Вайбкодинг, Веб-разработка, ML-инженер, Промт-инженер, Разработка ИИ-агентов, Дизайнер
Где отклик
Сайт вакансий

О компании

Sonatype — компания в сфере управления цепочками поставок программного обеспечения. Она управляет Maven Central — крупнейшим в мире репозиторием Java-компонентов с открытым исходным кодом. Платформу Sonatype используют более 2000 организаций, включая 70% компаний из Fortune 100, и более 15 миллионов разработчиков.

Роль

Ищем Data Scientist в растущую команду AI и Data Science. Вы будете работать как внутренний ИИ-консультант и технический лидер, помогая командам Sonatype применять машинное обучение и генеративный ИИ: от обнаружения вредоносного поведения и аномалий в данных безопасности до GenAI-решений для разработчиков и аналитиков. Вы будете исследовать сложные наборы данных, проектировать эксперименты, строить и валидировать модели, тесно сотрудничать с командами продукта, инженерии и безопасности, превращая исследовательские идеи в практические масштабируемые решения. У нас зрелая команда инженерии данных, поэтому вы сможете сосредоточиться на построении и запуске моделей. Роль подходит тому, кто комфортно работает с автономией, любит превращать неоднозначные идеи в работающие системы и предпочитает работать на стыке направлений.

Что вы будете делать

  • Вести прикладные AI-проекты от концепции до результата: прототипирование, валидация, помощь командам во внедрении практических ML и GenAI-решений.
  • Выступать внутренним консультантом для команд продукта, инженерии, безопасности и исследований: определять задачи, оценивать подходы, давать рекомендации по лучшим практикам ML/AI и продуктивному использованию генеративных технологий.
  • Руководить исследованиями, разработкой и внедрением моделей для таких задач, как обнаружение вредоносного поведения, аномалий и мошенничества — с использованием методов от классического ML до LLM, эмбеддингов, retrieval-augmented generation и агентных рабочих процессов.
  • Проектировать надёжные эксперименты и создавать пайплайны оценки надёжности, точности и бизнес-эффекта моделей (кросс-валидация, мониторинг дрейфа, оценка на эталонных данных).
  • Соединять исследования и продакшн: превращать исследовательские результаты в масштабируемые API, инструменты или рабочие процессы, позволяющие другим командам эффективно применять AI.
  • Исследовать новые техники (LLM, эмбеддинг-модели, RAG, агентные рабочие процессы) для улучшения опыта разработчиков и специалистов по безопасности.
  • Понятно доносить технические концепции, компромиссы и рекомендации до технических и нетехнических заинтересованных сторон через презентации, документацию и совместную работу; наставлять коллег и повышать AI-грамотность организации.
  • Сотрудничать с командой управления данными для соблюдения нормативных требований по конфиденциальности данных и этических соображений при работе с данными клиентов.

Что мы ждём

  • 5+ лет практического опыта в прикладной науке о данных, машинном обучении, AI-инженерии или AI-исследованиях.
  • Степень в области компьютерных наук или эквивалентную техническую степень (желательно).
  • Уверенные навыки Python и практический опыт работы с библиотеками и платформами для данных и AI: Databricks, LLM API, scikit-learn.
  • Опыт создания и запуска ML или GenAI-приложений — от раннего прототипа до рабочего внутреннего или клиентского процесса.
  • Глубокое знакомство с современными LLM-экосистемами: OpenAI, Anthropic/Claude, Hugging Face, модели с открытыми весами.
  • Умение выбирать модели и проектировать эффективные LLM-приложения с использованием промптинга, управления контекстом, структурированных выходов, поиска и использования инструментов.
  • Опыт создания агентных или многошаговых AI-рабочих процессов с LangGraph, LangChain, Semantic Kernel или аналогичными фреймворками оркестрации.
  • Сильное аналитическое мышление: определение полезных метрик качества, создание репрезентативных оценочных датасетов, оценка надёжности и принятие решений на основе данных.
  • Комфортная работа с большими, «грязными», структурированными и неструктурированными данными для создания признаков, инсайтов и понятных визуализаций.
  • Владение Git, тестированием, код-ревью и совместными практиками разработки ПО.
  • Практичный и взвешенный подход: интерес к новым возможностям AI при создании поддерживаемых, безопасных и надёжных систем.
  • Проактивность и ответственность, сильные письменные и устные коммуникативные навыки для работы с техническими и нетехническими специалистами.