Перейти к содержимому
К
Копылов Евгений Анатольевич
Москва
2 активна · проверена 16 часов назад

Инженер по оценке качества ИИ-агентов (AI Evals Engineer)

Вакансия для инженера, который будет строить систему оценки качества ИИ-агентов: автоматизированные evals, тестовые наборы, regression suites и release gates. Нужен опыт production-кода на Python, проектирования eval-систем для LLM-приложений и статистическая грамотность. Предлагают удалённую работу, высокую самостоятельность и возможность определять стандарты качества платформы.

senior удалённо от ~561 000 ₸ (от 100 000 RUB)
Языки: English · Intermediate
salary intelligence

Зарплата ниже рынка

На 56% ниже медианы Data/ML по 84 вакансиям за 90 дней.

эта
561 000 ₸
медиана
1 264 500 ₸
p25–p75
800 000 – 1 686 000 ₸
Хотите увидеть распределение по грейдам и городам? Зарплаты Data/ML Калькулятор зарплат
Вакансии в Telegram-канале
Свежие вакансии Каждый день
Подписаться
??%
Match Score
Войдите и создайте резюме
Войти
описание

Что предстоит делать

О продукте и стеке Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком. Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API. У направления оценки уже есть наработки и накопленная база знаний. Ваша задача — подключиться и развить их в полноценную систему: архитектура оценочного harness, выбор инструментов и стандартов за вами. Результат вашей работы — измеримое качество агентов и возможность выпускать изменения без неконтролируемых регрессий. Граница со смежной ролью: вы владеете инфраструктурой оценки — оценочным harness, тестовыми средами, release gates. Содержание доменных ролей агентов — знания, правила решений, обучающие наборы — зона Agent Knowledge Engineer, который работает внутри оценочного harness. Что предстоит делать Строить систему оценки качества агентов. Измеримые критерии успешного выполнения, эталонные наборы данных, сценарные тесты и автоматизированные evals для многошаговых процессов. Разбирать поведение агентов. Анализировать execution traces, tool calls, контекст и результаты; находить причины ошибок и деградации. Превращать отдельные сбои в воспроизводимые тесты и системные улучшения. Защищать продукт от регрессий. Regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации. Сравнение версий по качеству, стоимости, latency и устойчивости. Проектировать границы безопасного поведения. Разрешённые действия, схемы и контракты инструментов, проверки входов и выходов, approval gates, fallback- и escalation-механизмы. Проверять устойчивость к атакам. Red teaming: prompt injection, подмена контекста, ошибочные tool calls, зацикливание, превышение полномочий. Повышать надёжность в production. Трассировка, мониторинг качества, алерты, расследование инцидентов; retry, timeout, idempotency, восстановление. Метрики: task success rate, доля вмешательств человека, критические ошибки, latency, стоимость. Развивать общий harness платформы. Переиспользуемые компоненты и стандарты, ускоряющие безопасный запуск новых агентов и сценариев. Первые 90 дней Разобрать существующие наработки и довести их до первой полной версии системы evals: критерии успеха для текущих сценариев, эталонные наборы, автоматический прогон. Встроить regression suite и release gates в CI: изменения промптов, инструментов и моделей не выходят без сравнения версий по качеству, стоимости и latency. Настроить трассировку и наблюдаемость production-агентов: execution traces, tool calls, алерты по деградации качества. Обязательные требования По каждому пункту на интервью спросим детали и артефакты. • Production-код на Python: тестируемые backend-системы, pytest, Docker, CI (GitHub Actions или аналог). • Лично проектировали и строили систему оценки недетерминированной системы: автоматизированные evals, сценарные тесты, эталонные наборы. Использование готового чужого harness'а без проектирования собственного не засчитывается. • Практический опыт LLM-приложений или агентов: tool calling, оркестрация многошаговых сценариев, анализ логов и трасс, воспроизведение сложных сбоев. • Статистическая грамотность: размеры выборок, дисперсия, значимость различий между версиями недетерминированной системы. Без этого evals превращаются в театр — спросим об этом отдельно. • Понимание рисков production AI: prompt injection, некорректное использование инструментов, избыточные полномочия, зацикливание, неконтролируемый рост стоимости. • Английский B1 или выше. Будет преимуществом • Опыт с Langfuse, LangSmith, Arize Phoenix, OpenAI Evals, DeepEval, Ragas или аналогами. • LLM-as-a-judge пайплайны с проверкой качества самой оценки. • Red teaming LLM-систем, AI security, построение guardrails. • Симуляторы, генераторы тестовых данных, собственные evaluators. • OpenTelemetry и инженерные практики надёжности: observability, graceful degradation, incident analysis.

условия

Что предлагаем

Полная занятость, удалённая работа. Синхронное окно команды: с 10:00–11:00 до 20:00–21:00 МСК.
Возможность определять стандарты качества и надёжности агентной платформы.
Высокая самостоятельность в выборе подходов и инструментов; оценка по результату.
Как откликнуться
Вместо стандартного сопроводительного письма:
Разберите одну AI- или backend-систему, надёжность которой вы повысили: как работала, за что отвечали лично вы, что реализовали, как изменились качество и стабильность. Приложите верифицируемые артефакты: GitHub, пример спроектированного eval-набора или evaluator'а, технические статьи.
Ответьте на вопрос: как вы построите eval для многошагового агента, у которого успех задачи не сводится к сравнению вывода с эталоном? Как проверите, что LLM-as-judge оценивает верно?
Опишите, что в этом проекте не получилось и почему.
Отклики из общих формулировок без верифицируемых артефактов не рассматриваются.
навыки

Стек и инструменты

Поделиться

Подходит ли вам эта вакансия?

Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть

Создать аккаунт PDF-парсинг резюме за 2 минуты

Ещё в Копылов Евгений Анатольевич

10 активных вакансий в компании

1 д. назад

AI Agent Training Engineer

от ~561 000 ₸ (от 100 000 RUB)

Вакансия для инженера, который будет обучать ИИ-агентов выполнять профессиональные роли: формализовать знания экспертов, настраивать агентов, создавать обучающие и оценочные наборы, анализировать ошибки и улучшать поведение. Требуется опыт с Python и LLM-приложениями, умение проектировать evals. Предлагают удалённую работу и влияние на всю платформу.

AI LLM агенты +15
middle удал. hh
1 д. назад

AI Agent Training Engineer (Middle/Senior)

от ~561 000 ₸ (от 100 000 RUB)

Вакансия Middle/Senior инженера для обучения ИИ-агентов на B2B-платформе для рынка США. Нужно формализовать знания экспертов в правила и обучающие наборы, настраивать агентов на готовой архитектуре (Python, FastAPI, PostgreSQL, Redis, MCP) и проводить evals. Требуется опыт с LLM-приложениями, Python и английский B1+. Работа удалённая, полная занятость.

AI LLM агенты +16
middle удал. hh
1 д. назад

AI Agent Training Engineer

от ~561 000 ₸ (от 100 000 RUB)

Вакансия для инженера, который будет обучать ИИ-агентов выполнять профессиональные роли: формализовать знания экспертов, настраивать агентов, создавать обучающие и оценочные наборы, анализировать ошибки и улучшать поведение. Требуется опыт с Python и LLM-приложениями, умение проектировать evals. Предлагают удалённую работу и влияние на продукт.

AI LLM агенты +15
middle удал. hh
1 д. назад

Python-разработчик AI-агентов (Forward Deployed Engineer)

от ~841 500 ₸ (от 150 000 RUB)

Вакансия для опытного Python-разработчика, который будет проектировать и внедрять ИИ-агентов для B2B-платформы. Нужно глубокое знание Python, FastAPI, MCP и опыт доведения LLM-систем до production. Работа удалённая, полная занятость, с высокой самостоятельностью и ответственностью за результат.

AI LLM MCP +12
senior удал. hh

Похожие вакансии

6 вакансий
К
Копылов Евгений Анатольевич
1 д. назад

Инженер по оценке качества ИИ-агентов (AI Evals Engineer)

от ~561 000 ₸ (от 100 000 RUB)

Вакансия для инженера, который будет строить систему оценки качества ИИ-агентов: автоматизированные evals, сценарные тесты, regression suites и release gates. Нужен опыт production-кода на Python, проектирования eval-систем для LLM-приложений и статистическая грамотность. Работа удалённая, полная занятость, с высокой самостоятельностью и возможностью определять стандарты качества платформы.

Python FastAPI PostgreSQL +22
senior удал. hh
Digis
D
Digis
1 д. назад

Data Engineer

~2 618 070 – 3 615 430 ₸ оценка

Ищем опытного Data Engineer для работы над проектом в сфере гостиничной аналитики для американского клиента. Вы будете заниматься построением и оптимизацией пайплайнов данных, ETL-задач на Spark и AWS, а также работать с SQL и NoSQL базами данных. Требуется уверенный английский для общения с зарубежной командой, предлагается удаленная работа и хорошие условия.

Data Engineer Spark PySpark +10
senior удал. dou
SoftServe
S
SoftServe
1 д. назад

Senior Generative AI Engineer

Вакансія Senior Generative AI Engineer у SoftServe: розробка та впровадження AI-рішень для глобальних клієнтів. Потрібен досвід з Python, TensorFlow/PyTorch, знання LLM і NLP, англійська upper-intermediate. Пропонують гнучкий графік, конкурентну зарплату та розвиток.

Generative AI NLP LLM +6
senior удал. dou
C
COMFY
1 д. назад

Senior Data Scientist (Recommendations & Search)

COMFY шукає Senior Data Scientist для напряму рекомендацій та пошуку в e-commerce. Потрібен досвід з ML, статистикою та експериментами, впевнене володіння Python і SQL. Робота віддалена, з офісом у Дніпрі за бажанням, і можливістю впливати на продуктові та бізнес-метрики.

Data Science Recommendations Search +6
senior удал. dou
C
COMFY
1 д. назад

Senior Data Scientist

COMFY, українська e-commerce компанія, шукає Senior Data Scientist для напряму персоналізації пропозицій клієнтам. Роль передбачає побудову ML-моделей для вибору пропозицій, оцінку їх ефективності через експерименти та співпрацю з продуктовою інженерією. Потрібен досвід у Data Science, знання Python, SQL та статистики. Пропонують віддалену роботу та вплив на бізнес-метрики.

Data Science ML Python +6
senior удал. dou
C
COMFY
1 д. назад

Senior Data Scientist

COMFY шукає Senior Data Scientist для напряму Commercial Optimization. Ви будете досліджувати вплив ціни та промо на попит, будувати моделі price elasticity та сценарний аналіз, оцінювати бізнес-ефект. Потрібен досвід у pricing/promotion, сильна статистика, Python та SQL. Пропонують віддалену роботу, автономію та вплив на рішення великої e-commerce компанії.

Data Science Python SQL +10
senior удал. dou