Назад к вакансиям
remotevibecodingjobs18 августа 2026 г.

Инженер по оценке ИИ-агентов, разработчик задач

name

Вознаграждение$35–35
Локация
Remote
Формат
Удаленка
Направления
Вайбкодинг, Веб-разработка, ML-инженер, Промт-инженер, Тестировщик, DevOps, Разработка ИИ-агентов, Дизайнер, Автоматизация
Отклик
На remotevibecodingjobs

Компания Mindrift подбирает специалистов для проектной работы с ИИ-системами ведущих технологических компаний. Участие проектное, не постоянная занятость.

Роль: разработка задач на кодинг для frontier-моделей ИИ. Каждая задача — самодостаточное Docker-окружение с неработающим кодом, который агент должен исправить; автоматические тесты проверяют результат. Итоговый результат — полный пакет: сломанный код, тесты, инструкция и эталонное решение.

Задачи:

  • Придумать реалистичный сценарий разработчика — реальный баг, сломанный ETL, отсутствующая функция, а не учебная проблема.
  • Собрать воспроизводимое Docker-окружение с фиксированными зависимостями.
  • Написать pytest, проверяющий результат, а не команды, — детерминированный, стабильный, не раскрывающий исправление.
  • Написать instruction.md в формате Jira-тикета.
  • Написать эталонное решение solve.sh, доказывающее решаемость задачи.
  • Калибровать сложность так, чтобы современные агенты решали задачу в 20–60% случаев.
  • Дорабатывать задачи по обратной связи от экспертных QA-ревьюеров.
  • Позже — рецензировать задачи других авторов в роли QA-ревьюера.

Вне области: разметка данных, промт-инжиниринг, продакшн-код, задачи уровня Leetcode.

Требования:

  • 3+ года продакшн-разработки в одном бэкенд-стеке: Python, Go, Node.js, Java или Rust.
  • Свободное владение Python и pytest — обязательно независимо от основного стека: фикстуры, parametrize, monkeypatch, таймауты, conftest.py.
  • Опыт создания Docker-образов: воспроизводимые Dockerfile, фиксированные зависимости, multi-stage сборки, запуск от non-root пользователя.
  • Уверенная работа с Linux и Bash: отладка внутри контейнеров (strace, lsof, journalctl), shell-скрипты сложнее set -euo pipefail.
  • Опыт работы с ИИ-агентами кодинга — Claude Code, Cursor, Roo Code или аналогичными — на нетривиальных задачах; умение привести пример, когда ИИ уверенно ошибался, и как это было обнаружено.
  • Письменный английский уровня B2+.

Не подходит: инженеры Data Science, ML или Computer Vision без бэкенд-опыта; мануальные QA без автоматизации; фронтенд-only, low-code/no-code, IT-поддержка, бизнес-аналитики; инженеры без опыта написания pytest с нуля; джуниоры, интерны или ассистенты на последней позиции.

Предпочтительно:

  • Глубина в одной из областей: безопасность, системное администрирование (nginx, systemd, cron), научные вычисления (NumPy, PyTorch, SciPy), DevOps или внутренности Git.
  • Современный Python-тулинг: uv, poetry, pyproject.toml.
  • Инструменты покрытия: pytest-cov, coverage.py, gcov, llvm-cov, kcov.
  • Фаззинг или property-based тестирование (Hypothesis).
  • Опыт участия в бенчмарках оценки агентов.

Процесс: заявка → квалификационный этап (90-минутный тест-задача и короткое поведенческое интервью) → присоединение к проекту → выполнение задач → оплата.

Время: онбординг — около 10 часов на первую задачу; далее — около 5 часов на задачу, 2–4 параллельные задачи; реалистичная недельная нагрузка — 8–20 часов. График свободный, задачи сдаются к дедлайну и по критериям приёмки.

Оплата: до $35 в час, зависит от экспертизы, оценки навыков, локации и потребностей проекта. Возможны повышенные ставки для узких специалистов, пониженные — на онбординге. Детали оплаты сообщаются по каждому проекту.