Команда занимается обучением мультимодальных моделей рассуждать: понимать документы, графики, таблицы и интерфейсы, аккуратно распознавать текст, а также доводить поведение модели до продуктового качества через RLHF.
Задачи
- Развивать RL и RLHF для VLM: переосмыслить методы алайнмента на стыке визуальной и текстовой модальностей — как наградить модель за правильный визуальный reasoning, как отучить её галлюцинировать и как превратить продуктовые требования в функцию награды. Внедрять решения в RLHF-пайплайн, чтобы поведение модели было предсказуемым и полезным.
- Развивать reasoning и работу с документами (OCR): учить модель рассуждать над сложным визуальным контекстом — разбирать документы, таблицы, графики и интерфейсы, распознавать текст и следовать многошаговым инструкциям. Для этого предстоит собирать reasoning-данные и экспериментировать с UG-данными и AI-фидбэком.
- Разгонять large-scale-обучение до предельных скоростей: ускорять генерацию на лету, профилировать узкие места и добиваться, чтобы эксперименты крутились кратно быстрее, а GPU не простаивали ни секунды.
Требования
- Отличное знание классических ML, NLP и CV
- Понимание устройства современных LLM или VLM, опыт решения прикладных задач с их помощью
- Опыт работы с RL или RLHF, post-training или мультимодальным reasoning
- Слежение за трендами в области LLM и VLM
Будет плюсом
- Опыт работы с reasoning-задачами, post-training или RLHF/alignment
- Опыт обучения больших моделей или large-scale ML-систем
Условия
- Детские дни в офисе для детей сотрудников