Перейти к содержимому
К
Копылов Евгений Анатольевич
Москва
1 активна · проверена 15 часов назад

Инженер по оценке качества ИИ-агентов

Вакансия для инженера, который будет строить систему оценки качества ИИ-агентов: автоматизированные evals, regression suites, release gates, анализ поведения агентов и защита от регрессий. Требуется опыт production-кода на Python, проектирования eval-систем для LLM-приложений и статистическая грамотность. Предлагают удалённую работу, высокую самостоятельность и возможность определять стандарты качества платформы.

senior удалённо от ~561 000 ₸ (от 100 000 RUB)
Языки: English · Intermediate
salary intelligence

Зарплата ниже рынка

На 53% ниже медианы Python по 113 вакансиям за 90 дней.

эта
561 000 ₸
медиана
1 180 200 ₸
p25–p75
843 000 – 1 601 700 ₸
Хотите увидеть распределение по грейдам и городам? Зарплаты Python Калькулятор зарплат
Вакансии в Telegram-канале
Свежие вакансии Каждый день
Подписаться
??%
Match Score
Войдите и создайте резюме
Войти
описание

Что предстоит делать

О продукте и стеке Мы создаём B2B-платформу автономных ИИ-агентов для рынка США. Агенты ведут многошаговые рабочие процессы с несколькими участниками — со сроками, документами и перепиской — и выполняют действия во внешних системах: электронная почта, CRM, календари, документы. Ключевые действия проходят через подтверждение человеком. Стек платформы: Python, FastAPI, PostgreSQL, Redis, MCP. Используем managed-модели Anthropic, OpenAI и Google через API. У направления оценки уже есть наработки и накопленная база знаний. Ваша задача — подключиться и развить их в полноценную систему: архитектура оценочного harness, выбор инструментов и стандартов за вами. Результат вашей работы — измеримое качество агентов и возможность выпускать изменения без неконтролируемых регрессий. Граница со смежной ролью: вы владеете инфраструктурой оценки — оценочным harness, тестовыми средами, release gates. Содержание доменных ролей агентов — знания, правила решений, обучающие наборы — зона Agent Knowledge Engineer, который работает внутри оценочного harness. Что предстоит делать Строить систему оценки качества агентов. Измеримые критерии успешного выполнения, эталонные наборы данных, сценарные тесты и автоматизированные evals для многошаговых процессов. Разбирать поведение агентов. Анализировать execution traces, tool calls, контекст и результаты; находить причины ошибок и деградации. Превращать отдельные сбои в воспроизводимые тесты и системные улучшения. Защищать продукт от регрессий. Regression suites и release gates для изменений моделей, промптов, инструментов и оркестрации. Сравнение версий по качеству, стоимости, latency и устойчивости. Проектировать границы безопасного поведения. Разрешённые действия, схемы и контракты инструментов, проверки входов и выходов, approval gates, fallback- и escalation-механизмы. Проверять устойчивость к атакам. Red teaming: prompt injection, подмена контекста, ошибочные tool calls, зацикливание, превышение полномочий. Повышать надёжность в production. Трассировка, мониторинг качества, алерты, расследование инцидентов; retry, timeout, idempotency, восстановление. Метрики: task success rate, доля вмешательств человека, критические ошибки, latency, стоимость. Развивать общий harness платформы. Переиспользуемые компоненты и стандарты, ускоряющие безопасный запуск новых агентов и сценариев. Первые 90 дней Разобрать существующие наработки и довести их до первой полной версии системы evals: критерии успеха для текущих сценариев, эталонные наборы, автоматический прогон. Встроить regression suite и release gates в CI: изменения промптов, инструментов и моделей не выходят без сравнения версий по качеству, стоимости и latency. Настроить трассировку и наблюдаемость production-агентов: execution traces, tool calls, алерты по деградации качества. Обязательные требования По каждому пункту на интервью спросим детали и артефакты. • Production-код на Python: тестируемые backend-системы, pytest, Docker, CI (GitHub Actions или аналог). • Лично проектировали и строили систему оценки недетерминированной системы: автоматизированные evals, сценарные тесты, эталонные наборы. Использование готового чужого harness'а без проектирования собственного не засчитывается. • Практический опыт LLM-приложений или агентов: tool calling, оркестрация многошаговых сценариев, анализ логов и трасс, воспроизведение сложных сбоев. • Статистическая грамотность: размеры выборок, дисперсия, значимость различий между версиями недетерминированной системы. Без этого evals превращаются в театр — спросим об этом отдельно. • Понимание рисков production AI: prompt injection, некорректное использование инструментов, избыточные полномочия, зацикливание, неконтролируемый рост стоимости. • Английский B1 или выше. Будет преимуществом • Опыт с Langfuse, LangSmith, Arize Phoenix, OpenAI Evals, DeepEval, Ragas или аналогами. • LLM-as-a-judge пайплайны с проверкой качества самой оценки. • Red teaming LLM-систем, AI security, построение guardrails. • Симуляторы, генераторы тестовых данных, собственные evaluators. • OpenTelemetry и инженерные практики надёжности: observability, graceful degradation, incident analysis.

условия

Что предлагаем

Полная занятость, удалённая работа. Синхронное окно команды: с 10:00–11:00 до 20:00–21:00 МСК.
Возможность определять стандарты качества и надёжности агентной платформы.
Высокая самостоятельность в выборе подходов и инструментов; оценка по результату.
Как откликнуться
Вместо стандартного сопроводительного письма:
Разберите одну AI- или backend-систему, надёжность которой вы повысили: как работала, за что отвечали лично вы, что реализовали, как изменились качество и стабильность. Приложите верифицируемые артефакты: GitHub, пример спроектированного eval-набора или evaluator'а, технические статьи.
Ответьте на вопрос: как вы построите eval для многошагового агента, у которого успех задачи не сводится к сравнению вывода с эталоном? Как проверите, что LLM-as-judge оценивает верно?
Опишите, что в этом проекте не получилось и почему.
Отклики из общих формулировок без верифицируемых артефактов не рассматриваются.
навыки

Стек и инструменты

Поделиться

Подходит ли вам эта вакансия?

Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть

Создать аккаунт PDF-парсинг резюме за 2 минуты

Ещё в Копылов Евгений Анатольевич

10 активных вакансий в компании

1 д. назад

AI Agent Training Engineer

от ~561 000 ₸ (от 100 000 RUB)

Вакансия для инженера, который будет обучать ИИ-агентов выполнять профессиональные роли: формализовать знания экспертов, настраивать агентов, создавать обучающие и оценочные наборы, анализировать ошибки и улучшать поведение. Требуется опыт с Python и LLM-приложениями, умение проектировать evals. Предлагают удалённую работу и влияние на всю платформу.

AI LLM агенты +15
middle удал. hh
1 д. назад

AI Agent Training Engineer (Middle/Senior)

от ~561 000 ₸ (от 100 000 RUB)

Вакансия Middle/Senior инженера для обучения ИИ-агентов на B2B-платформе для рынка США. Нужно формализовать знания экспертов в правила и обучающие наборы, настраивать агентов на готовой архитектуре (Python, FastAPI, PostgreSQL, Redis, MCP) и проводить evals. Требуется опыт с LLM-приложениями, Python и английский B1+. Работа удалённая, полная занятость.

AI LLM агенты +16
middle удал. hh
1 д. назад

AI Agent Training Engineer

от ~561 000 ₸ (от 100 000 RUB)

Вакансия для инженера, который будет обучать ИИ-агентов выполнять профессиональные роли: формализовать знания экспертов, настраивать агентов, создавать обучающие и оценочные наборы, анализировать ошибки и улучшать поведение. Требуется опыт с Python и LLM-приложениями, умение проектировать evals. Предлагают удалённую работу и влияние на продукт.

AI LLM агенты +15
middle удал. hh
1 д. назад

Python-разработчик AI-агентов (Forward Deployed Engineer)

от ~841 500 ₸ (от 150 000 RUB)

Вакансия для опытного Python-разработчика, который будет проектировать и внедрять ИИ-агентов для B2B-платформы. Нужно глубокое знание Python, FastAPI, MCP и опыт доведения LLM-систем до production. Работа удалённая, полная занятость, с высокой самостоятельностью и ответственностью за результат.

AI LLM MCP +12
senior удал. hh

Похожие вакансии

6 вакансий
Performa HR-agency
P
Performa HR-agency
1 д. назад

Старший Python Backend разработчик

~2 304 214 ₸ оценка

Ищем старшего Python-разработчика для создания real-time платформы для криптоарбитража. Нужен опыт с asyncio, FastAPI, PostgreSQL, Kafka/NATS и интеграцией биржевых API. Предлагают удаленную работу, оплату в USD и небольшую продуктовую команду.

Python asyncio FastAPI +14
senior удал. dj
SevenPro
S
SevenPro
1 д. назад

Старший Python разработчик

~2 304 214 ₸ оценка

Старший Python-разработчик для платформенной команды в нефтегазовом SaaS-продукте. Нужно проектировать сервисы на Python (Flask/FastAPI), работать с большими данными (Polars, Iceberg) и разворачивать на GCP. Требуется 5+ лет опыта, сильные знания Python и архитектуры, плюс опыт с LLM/AI-агентами.

Python Flask FastAPI +18
senior удал. dou
Mobilunity
M
Mobilunity
1 д. назад

Старший Python инженер

~2 304 214 ₸ оценка

Старший Python-инженер для финтех-платформы из Великобритании. Нужно проектировать и разрабатывать масштабируемые backend-сервисы на Python, использовать AWS (Lambda, DynamoDB, EventBridge), Terraform и SQL. Требуется продвинутый английский и опыт работы с AI-инструментами. Предлагают удаленную работу или офис в Киеве, медстраховку, оплачиваемые отпуска и курсы английского.

Python AWS Lambda +7
senior удал. dou
N-IX
N
N-IX
1 д. назад

Старший Python разработчик

Ищем опытного Python-разработчика для команды, которая занимается KYC-сервисами — проверкой клиентов финансовых продуктов. Нужно будет проектировать и развивать микросервисы, интегрироваться с внешними провайдерами и поддерживать сервисы на всех этапах. Требуется уверенный опыт с Python, микросервисами, MySQL, Kafka и Docker, а также хороший английский. Предлагают гибкий формат работы, конкурентную зарплату и возможности для роста.

Python Microservices MySQL +8
senior удал. dou
MWDN
M
MWDN
1 д. назад

Старший Backend разработчик (Python/Go)

~2 304 214 ₸ оценка

Старший backend-разработчик для AdTech-проекта: проектировать и развивать высоконагруженные сервисы доставки рекламы и аналитики на Python/Go и AWS. Нужен опыт 5+ лет, глубокие знания Celery, оптимизации производительности и распределённых систем. Предлагают гибкий график, 29 дней отпуска, бесплатные уроки английского и поддержку контракторов.

Python Go AWS +34
senior удал. dou
A-listware
A
A-listware
1 д. назад

Старший Full Stack инженер

~2 304 214 ₸ оценка

Ищем старшего Full Stack инженера для разработки современных продуктов с AI-функциями. Нужно проектировать и разрабатывать функции на фронтенде и бэкенде, интегрировать LLM-сервисы и работать в Azure. Требуется 6+ лет опыта, уверенное владение Python, JavaScript/TypeScript и React, а также отличный английский.

Python JavaScript TypeScript +16
senior удал. dou