Инженер по оценке качества ИИ-агентов (AI Evals Engineer)
Вакансия для инженера, который будет строить систему оценки качества ИИ-агентов: автоматизированные evals, тестовые наборы, regression suites и release gates. Нужен опыт production-кода на Python, проектирования eval-систем для LLM-приложений и статистическая грамотность. Предлагают удалённую работу, высокую самостоятельность и возможность определять стандарты качества платформы.
Зарплата ниже рынка
На 56% ниже медианы Data/ML по 84 вакансиям за 90 дней.
Что предстоит делать
О продукте и стеке Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком. Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API. У направления оценки уже есть наработки и накопленная база знаний. Ваша задача — подключиться и развить их в полноценную систему: архитектура оценочного harness, выбор инструментов и стандартов за вами. Результат вашей работы — измеримое качество агентов и возможность выпускать изменения без неконтролируемых регрессий. Граница со смежной ролью: вы владеете инфраструктурой оценки — оценочным harness, тестовыми средами, release gates. Содержание доменных ролей агентов — знания, правила решений, обучающие наборы — зона Agent Knowledge Engineer, который работает внутри оценочного harness. Что предстоит делать Строить систему оценки качества агентов. Измеримые критерии успешного выполнения, эталонные наборы данных, сценарные тесты и автоматизированные evals для многошаговых процессов. Разбирать поведение агентов. Анализировать execution traces, tool calls, контекст и результаты; находить причины ошибок и деградации. Превращать отдельные сбои в воспроизводимые тесты и системные улучшения. Защищать продукт от регрессий. Regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации. Сравнение версий по качеству, стоимости, latency и устойчивости. Проектировать границы безопасного поведения. Разрешённые действия, схемы и контракты инструментов, проверки входов и выходов, approval gates, fallback- и escalation-механизмы. Проверять устойчивость к атакам. Red teaming: prompt injection, подмена контекста, ошибочные tool calls, зацикливание, превышение полномочий. Повышать надёжность в production. Трассировка, мониторинг качества, алерты, расследование инцидентов; retry, timeout, idempotency, восстановление. Метрики: task success rate, доля вмешательств человека, критические ошибки, latency, стоимость. Развивать общий harness платформы. Переиспользуемые компоненты и стандарты, ускоряющие безопасный запуск новых агентов и сценариев. Первые 90 дней Разобрать существующие наработки и довести их до первой полной версии системы evals: критерии успеха для текущих сценариев, эталонные наборы, автоматический прогон. Встроить regression suite и release gates в CI: изменения промптов, инструментов и моделей не выходят без сравнения версий по качеству, стоимости и latency. Настроить трассировку и наблюдаемость production-агентов: execution traces, tool calls, алерты по деградации качества. Обязательные требования По каждому пункту на интервью спросим детали и артефакты. • Production-код на Python: тестируемые backend-системы, pytest, Docker, CI (GitHub Actions или аналог). • Лично проектировали и строили систему оценки недетерминированной системы: автоматизированные evals, сценарные тесты, эталонные наборы. Использование готового чужого harness'а без проектирования собственного не засчитывается. • Практический опыт LLM-приложений или агентов: tool calling, оркестрация многошаговых сценариев, анализ логов и трасс, воспроизведение сложных сбоев. • Статистическая грамотность: размеры выборок, дисперсия, значимость различий между версиями недетерминированной системы. Без этого evals превращаются в театр — спросим об этом отдельно. • Понимание рисков production AI: prompt injection, некорректное использование инструментов, избыточные полномочия, зацикливание, неконтролируемый рост стоимости. • Английский B1 или выше. Будет преимуществом • Опыт с Langfuse, LangSmith, Arize Phoenix, OpenAI Evals, DeepEval, Ragas или аналогами. • LLM-as-a-judge пайплайны с проверкой качества самой оценки. • Red teaming LLM-систем, AI security, построение guardrails. • Симуляторы, генераторы тестовых данных, собственные evaluators. • OpenTelemetry и инженерные практики надёжности: observability, graceful degradation, incident analysis.
Что предлагаем
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Ещё в Копылов Евгений Анатольевич
10 активных вакансий в компании
AI Agent Training Engineer
Вакансия для инженера, который будет обучать ИИ-агентов выполнять профессиональные роли: формализовать знания экспертов, настраивать агентов, создавать обучающие и оценочные наборы, анализировать ошибки и улучшать поведение. Требуется опыт с Python и LLM-приложениями, умение проектировать evals. Предлагают удалённую работу и влияние на всю платформу.
AI Agent Training Engineer (Middle/Senior)
Вакансия Middle/Senior инженера для обучения ИИ-агентов на B2B-платформе для рынка США. Нужно формализовать знания экспертов в правила и обучающие наборы, настраивать агентов на готовой архитектуре (Python, FastAPI, PostgreSQL, Redis, MCP) и проводить evals. Требуется опыт с LLM-приложениями, Python и английский B1+. Работа удалённая, полная занятость.
AI Agent Training Engineer
Вакансия для инженера, который будет обучать ИИ-агентов выполнять профессиональные роли: формализовать знания экспертов, настраивать агентов, создавать обучающие и оценочные наборы, анализировать ошибки и улучшать поведение. Требуется опыт с Python и LLM-приложениями, умение проектировать evals. Предлагают удалённую работу и влияние на продукт.
Python-разработчик AI-агентов (Forward Deployed Engineer)
Вакансия для опытного Python-разработчика, который будет проектировать и внедрять ИИ-агентов для B2B-платформы. Нужно глубокое знание Python, FastAPI, MCP и опыт доведения LLM-систем до production. Работа удалённая, полная занятость, с высокой самостоятельностью и ответственностью за результат.
Похожие вакансии
6 вакансийИнженер по оценке качества ИИ-агентов (AI Evals Engineer)
Вакансия для инженера, который будет строить систему оценки качества ИИ-агентов: автоматизированные evals, сценарные тесты, regression suites и release gates. Нужен опыт production-кода на Python, проектирования eval-систем для LLM-приложений и статистическая грамотность. Работа удалённая, полная занятость, с высокой самостоятельностью и возможностью определять стандарты качества платформы.
Data Engineer
~2 618 070 – 3 615 430 ₸ оценка
Ищем опытного Data Engineer для работы над проектом в сфере гостиничной аналитики для американского клиента. Вы будете заниматься построением и оптимизацией пайплайнов данных, ETL-задач на Spark и AWS, а также работать с SQL и NoSQL базами данных. Требуется уверенный английский для общения с зарубежной командой, предлагается удаленная работа и хорошие условия.
Senior Generative AI Engineer
Вакансія Senior Generative AI Engineer у SoftServe: розробка та впровадження AI-рішень для глобальних клієнтів. Потрібен досвід з Python, TensorFlow/PyTorch, знання LLM і NLP, англійська upper-intermediate. Пропонують гнучкий графік, конкурентну зарплату та розвиток.
Senior Data Scientist (Recommendations & Search)
COMFY шукає Senior Data Scientist для напряму рекомендацій та пошуку в e-commerce. Потрібен досвід з ML, статистикою та експериментами, впевнене володіння Python і SQL. Робота віддалена, з офісом у Дніпрі за бажанням, і можливістю впливати на продуктові та бізнес-метрики.
Senior Data Scientist
COMFY, українська e-commerce компанія, шукає Senior Data Scientist для напряму персоналізації пропозицій клієнтам. Роль передбачає побудову ML-моделей для вибору пропозицій, оцінку їх ефективності через експерименти та співпрацю з продуктовою інженерією. Потрібен досвід у Data Science, знання Python, SQL та статистики. Пропонують віддалену роботу та вплив на бізнес-метрики.
Senior Data Scientist
COMFY шукає Senior Data Scientist для напряму Commercial Optimization. Ви будете досліджувати вплив ціни та промо на попит, будувати моделі price elasticity та сценарний аналіз, оцінювати бізнес-ефект. Потрібен досвід у pricing/promotion, сильна статистика, Python та SQL. Пропонують віддалену роботу, автономію та вплив на рішення великої e-commerce компанії.