Команда развивает поисковую строку с Алисой. Основополагающая часть любого ML — датасеты, команда отвечает за ускорение и удешевление процесса их сбора. От этого зависит частота релизов, которые напрямую влияют на пользователей Поиска. Работа с быстро развивающимися продуктами на стыке ML и краудсорсинга.
Задачи
- Встраивание ML-моделей в инфраструктуру разметок. Современные генеративные модели позволяют получить качество разметки, сопоставимое с человеческой или даже лучше, на простых задачах, а также ускорить процесс разметки асессорами при помощи генеративных подсказок. Задача — строить надёжные пайплайны инференса моделей, оптимизировать их и собирать дополнительные данные, необходимые для применения моделей.
- Построение витрины разметок. В Поиске есть несколько крупных (по бюджету и количеству заданий) разметок, и в них в разной степени внедрены ML-модели. Нужно создать единую витрину, где можно будет увидеть объёмы разметки, полученной от асессоров и моделей, степень внедрения этих моделей, затраты на разные компоненты и другие показатели.
Требования
- Хорошее знание Python
- Знание SQL или ClickHouse
Будет плюсом
- Опыт с технологиями обработки больших данных
- Опыт работы с ML-моделями и агентами
- Умение строить читаемые графики и дашборды
Бонусы
В крупных офисах есть спортзалы — с тренажёрами, инвентарём и душевыми.