Назад к вакансиям
remotevibecodingjobs19 августа 2026 г.

Senior AI Evaluation Engineer, Python

Mindrift

ВознаграждениеПо договорённости
Локация
Anywhere
Формат
Удаленка
Направления
Вайбкодинг, Веб-разработка, Промт-инженер, Тестировщик, DevOps, Разработка ИИ-агентов, Дизайнер
Отклик
На remotevibecodingjobs

О компании и формате

Mindrift — платформа, соединяющая специалистов с проектными задачами в области ИИ для ведущих технологических компаний. Работа связана с тестированием, оценкой и улучшением ИИ-систем. Участие проектное, не постоянная занятость.

Задачи

  • Создание реалистичных сред разработки: виртуальная компания с кодовой базой, инфраструктурой и контекстом (тикеты, документация, переписка), формирующим правдоподобную историю разработки.
  • Проектирование задач из промежуточных состояний этих сред: формулировка промпта, определение критериев «решено», обеспечение решаемости задачи ИИ-агентом.
  • Написание тестов, проверяющих решения агента: принимать все корректные подходы и отклонять некорректные, не слишком строго и не слишком мягко.
  • Итеративная доработка задач и тестов на основе QA-обратной связи: анализ решений агента, разбор ошибок, улучшение до справедливой и надёжной оценки.

Задачи должны по-настоящему бросать вызов лучшим моделям: frontier-модели уже хорошо пишут код, поэтому важно понимать, где модели ошибаются, и создавать сценарии, выявляющие разницу между хорошим и плохим решением. У задач много корректных решений, поэтому написание тестов, принимающих все правильные варианты и отклоняющих неверные, сложнее, чем кажется.

Чем это не является

  • Не разметка данных.
  • Не промпт-инжиниринг.
  • Не написание кода с нуля — большую часть кода пишет агент; вы направляете и оцениваете.

Требования

  • Опыт разработки ПО от 5 лет.
  • Основной стек: Python (FastAPI), JavaScript/TypeScript (React), Docker, Postgres, Kafka, Redis.
  • Опыт написания тестов (функциональных, интеграционных).
  • Владение английским языком на уровне B2 и выше.

Условия

  • Оплата до $50/час в эквиваленте, в зависимости от уровня и темпа.
  • Задачи оцениваются примерно в 20 часов каждая.
  • Вы сами устанавливаете свой график.