Инженер по надежности ИИ (AI Reliability Engineer)
Инженерная роль в EPAM: вы будете обеспечивать надежность продакшн-систем на базе ИИ и LLM — инструментировать, мониторить, определять SLO, внедрять оценку качества и оптимизировать затраты. Требуется опыт в SRE/DevOps, Python, OpenTelemetry, Kubernetes и облаках. Предлагают удаленную работу из Украины, гибкий график, обучение и сертификации.
Зарплата не указана — оценили по рынку
На основе 7 похожих вакансий за 90 дней.
Что предстоит делать
<p>Практика Operational Intelligence в EPAM создает новое направление: AI Reliability Engineering (AIRE) — применение принципов SRE и cloud-native практик к жизненному циклу production AI/ML и LLM систем. Когда клиенты переводят GenAI-приложения и агентные системы из пилота в продакшн, они обнаруживают, что классический APM ничего не говорит им о задержке токенов, стоимости запроса, семантическом дрейфе или галлюцинациях. Именно этот пробел закрывает данная роль.</p><p>Вы будете инструментировать, мониторить и укреплять production AI-системы, определять AI-нативные цели уровня обслуживания и создавать акселераторы и эталонные архитектуры, которые наша практика переиспользует в проектах. Это инженерная роль, а не поддержка L1/L2 — без круглосуточных дежурств.</p><p><strong>Что вы получите</strong></p><ul><li>По-настоящему новое направление внутри EPAM — вы определяете, как оно работает, а не следуете существующему регламенту</li><li>Инженерный фокус без круглосуточных дежурств</li><li>Оплачиваемые сертификации и программы обучения (Anthropic/Claude, Databricks, AI & Data Observability учебные треки)</li><li>Работа с разными клиентами и прямой путь в пресейл и решение инженерных задач</li></ul><p><strong>Обратите внимание: эта роль поддерживает удаленную работу, но только из Украины.</strong></p><p><strong>Обязанности</strong></p><ul><li>Инструментировать production LLM, RAG и агентные приложения с помощью AI-телеметрии на основе OpenTelemetry и APM-нативного AI-мониторинга</li><li>Внедрять распределенную трассировку в мультимодельных цепочках, агентных рабочих процессах и пайплайнах retrieval-augmented generation для профилирования системных задержек и точек отказа</li><li>Определять и измерять AI-нативные SLI и SLO: время до первого токена (TTFT), пропускную способность, частоту ошибок и отказов, стоимость запроса, семантический дрейф, границы галлюцинаций, контекстуальную точность</li><li>Настраивать структурированное семантическое логирование и мониторинг промптов/ответов для анализа качества</li><li>Создавать и запускать циклы оценки качества и безопасности выходных данных — golden sets, LLM-as-a-judge, фреймворки в стиле Ragas/DeepEval — и интегрировать их в CI/CD и рантайм</li><li>Отслеживать облачные расходы на основе токенов, лимиты скорости API моделей и потребление квот; управлять оптимизацией затрат на AI</li><li>Настраивать AI-шлюзы для балансировки нагрузки API, отказоустойчивости и fallback-моделей у нескольких LLM-провайдеров</li><li>Внедрять защитные механизмы: фильтрацию prompt injection и jailbreak, соответствие выходных данных, ограничения по предвзятости и безопасности</li><li>Проектировать рабочие процессы обнаружения, триажа, восстановления и управления проблемами для AI-инцидентов; интегрировать автономных AI-агентов в RCA для анализа логов, формирования гипотез и корреляции изменений состояния</li><li>Поддерживать паттерны отката, canary и fail-safe для релизов моделей, промптов и конфигураций; обеспечивать воспроизводимость через версионирование данных, кода, промптов и моделей</li><li>Создавать акселераторы практики, эталонные архитектуры и внутренние обучающие материалы; поддерживать пресейл и оценку клиентов</li></ul><p><strong>Требования</strong></p><ul><li>4+ года в SRE, DevOps, платформенной или observability-инженерии, включая практическую работу с production AI/ML или LLM нагрузками</li><li>Твердые основы SRE: Golden Signals, определение SLI/SLO, error budgets и burn rate, жизненный цикл инцидентов, основы ITIL</li><li>Уверенное знание Python для инструментирования, автоматизации и инструментов оценки</li><li>Практический опыт с OpenTelemetry и как минимум одной APM/observability-платформой: New Relic, Datadog, Grafana LGTM стек, Splunk или Elastic</li><li>Практический production-опыт с как минимум одной облачной платформой (предпочтительно Azure, AWS или GCP) и Kubernetes</li><li>Рабочее понимание архитектуры LLM-приложений: промпты, эмбеддинги и векторные базы данных, RAG, оркестрация агентов (LangChain / LangGraph или эквивалент)</li><li>Осведомленность в MLOps: жизненный цикл моделей (обучение vs. инференс), эндпоинты моделей, контейнеризация, паттерны деплоя и отката</li><li>Infrastructure as Code с Terraform; опыт CI/CD (Azure DevOps, GitLab CI, GitHub Actions)</li><li>Английский B2+ — роль предполагает работу с клиентами и требует четкой письменной и устной технической коммуникации</li></ul><p><strong>Будет плюсом</strong></p><ul><li>Опыт с AI-специфичными observability и evaluation инструментами: Traceloop/OpenLLMetry, Langfuse, Arize Phoenix, Ragas, DeepEval, MLflow</li><li>Распределенный инференс в масштабе: vLLM, KServe, Ray Serve, Kubernetes-нативная LLM-оркестрация, планирование мощностей GPU</li><li>AI-безопасность: OWASP LLM Top 10, защита от prompt injection, фреймворки guardrails (NeMo Guardrails, Llama Guard)</li><li>Опыт с Databricks (включая Mosaic AI / MLflow) или Azure AI Foundry</li><li>Сертификации: Anthropic Claude, Azure AI Engineer, AWS ML Specialty, Databricks GenAI</li><li>FinOps для AI-нагрузок — моделирование затрат на токены и GPU</li><li>Опыт в Data Reliability Engineering (качество данных, SLO пайплайнов) — надежность AI начинается с надежности данных</li><li>Опыт менторства или руководства командой</li></ul><p><strong>Мы предлагаем/Преимущества</strong></p><p><strong>С нами вы можете:</strong></p><ul><li>Работать по гибкому графику удаленно или из любого нашего комфортного офиса или коворкинга в Украине</li><li>Получить необходимое оборудование для выполнения рабочих задач</li><li>Менять проекты и технологические стеки внутри EPAM</li><li>Получить опыт в различных бизнес-доменах (Страхование, E-commerce, Здравоохранение, Финансы, Путешествия, Медиа, Искусственный интеллект и другие)</li><li>Возможности релокации могут быть доступны для подходящих кандидатов в зависимости от роли и открытых позиций в других локациях EPAM</li><li>Участвовать в волонтерских, благотворительных программах и сообществах (как технических, так и по интересам)</li></ul><p><strong>Мы фокусируемся на вашем профессиональном росте:</strong></p><ul><li>Вы можете планировать свой индивидуальный карьерный путь вместе с вашим менеджером</li><li>Получать регулярную обратную связь от коллег</li><li>Бесплатно улучшать свой английский с сертифицированными преподавателями (разговорные клубы, курсы подготовки к собеседованиям с клиентами и т.д.)</li><li>Получить возможность бесплатного обучения и сертификации в AWS, GCP или Azure Clouds</li><li>Использовать внутреннюю программу обучения E-learn (18 200+ специализированных тренингов и менторских программ)</li><li>Доступ к корпоративным аккаунтам на LinkedIn Learning, Get Abstract и других партнерских ресурсах</li><li>Учиться в EPAM Solution Architecture School с преподавателями, которые являются практикующими архитекторами</li><li>Развиваться как лидер, присоединяться к Delivery Management, Resource Management, Leadership Essentials school и другим программам</li><li>Участвовать во внутренних сообществах (500+ митапов, технических дискуссий, мозговых штурмов, онлайн-мероприятий и конференций ежегодно)</li></ul><p><strong>Что мы предлагаем:</strong></p><ul><li>Отпуск и больничные (включая больничный без медицинской справки)</li><li>Широкий спектр программ добровольного медицинского страхования, покрывающих как медицинское лечение, так и различные профилактические опции (включая спортивные активности)</li><li>Медицинская страховка для членов семьи по корпоративным тарифам</li><li>Поддержка компании в значимые жизненные события (рождение или усыновление ребенка, бракосочетание и т.д.)</li><li>Поддержка психологического комфорта: скидки на услуги специалистов по психическому здоровью или коучей, тематические тренинги</li><li>Программа E-kids — бесплатная программа обучения языкам программирования для детей сотрудников EPAM</li></ul><p>Обратите внимание, что набор льгот, включая обучение, сертификацию и другие возможности, может варьироваться в зависимости от роли, на которую вы претендуете. Наш рекрутер сможет предоставить более подробную информацию о конкретной возможности во время вашего общего собеседования.</p><p><strong>О КОМПАНИИ EPAM</strong></p><p>EPAM стремится предоставить своей глобальной команде из более чем 62 350 профессионалов в более чем 55 странах возможности для профессионального роста с первого дня сотрудничества. Наши коллеги — источник успеха EPAM, поэтому мы ценим сотрудничество, стремимся всегда понимать бизнес наших клиентов и нацелены на высочайшие стандарты качества. Где бы вы ни находились, вы присоединитесь к целеустремленному, разнообразному сообществу, которое поможет вам полностью реализовать свой потенциал.</p> <div> <a href="https://jobs.dou.ua/companies/epam-systems/vacancies/370843/#reply-btn-id">Откликнуться на вакансию</a> </div>
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Ещё в EPAM Systems
26 активных вакансий в компании
Инженер платформы (DevOps)
Инженер платформы для модернизации POS-систем в магазинах. Нужно работать с Kubernetes, Linux, CI/CD и автоматизацией, обеспечивая высокую доступность и наблюдаемость. Предлагается удаленная работа в Литве.
Старший Python инженер с AI
Старший Python-инженер с опытом в AI будет разрабатывать AI-прототипы и кастомные GPT-решения, используя LLM-фреймворки и облачные технологии. Требуется 3+ года опыта в Python, знание LangChain, LlamaIndex, Docker и Azure. Компания предлагает удаленную работу из Украины, гибкий график и возможности профессионального роста.
Ведущий инженер по миграции и автоматизации (Java/.NET, Azure)
Ведущий инженер будет руководить миграцией и автоматизацией Java/.NET систем в Azure, проектировать и автоматизировать облачные и локальные среды, CI/CD и безопасность. Требуется опыт с Terraform, Python и PowerShell. Предлагается удаленная работа из Латвии.
Ведущий инженер по автоматизации QA
Ищем ведущего инженера по автоматизации QA для разработки фреймворка тестирования API и интеграций. Нужен опыт в автоматизации, лидерские качества и знание AI-инструментов. Предлагается удаленная работа из Литвы.
Похожие вакансии
6 вакансийDevOps/SRE инженер (Azure, AKS, Terraform)
~2 257 877 ₸ оценка
Ищем опытного DevOps/SRE инженера для работы над крупным европейским банковским проектом. Вы будете автоматизировать жизненный цикл сред, управлять кластерами AKS и развивать CI/CD пайплайны в Azure. Требуется глубокое знание Azure, Terraform, Kubernetes и скриптовых языков. Предлагается удалённая работа и долгосрочное сотрудничество.
DevOps/SRE инженер (Azure, AKS)
~2 257 877 ₸ оценка
Ищем опытного DevOps/SRE инженера для работы над крупным европейским банковским проектом. Вы будете автоматизировать инфраструктуру на Azure (AKS, Terraform, Azure DevOps), управлять CI/CD и обеспечивать безопасность в регулируемой среде. Требуется глубокое знание Azure, Kubernetes, Terraform и скриптовых языков, а также английский на уровне B2+. Предлагается полностью удаленная работа и долгосрочное сотрудничество.
DevOps/SRE инженер (Cloud Engineering)
~2 257 877 ₸ оценка
Pindrop ищет опытного DevOps/SRE инженера для работы над облачной инфраструктурой на AWS и GCP. Вы будете проектировать и поддерживать высоконагруженные сервисы, автоматизировать процессы и улучшать наблюдаемость. Требуется 5–7 лет опыта, знание Kubernetes, Terraform и CI/CD. Предлагается удалённая работа и контракт через Alcor BPO.
Data Platform Engineer / Data DevOps
~2 257 877 ₸ оценка
Ищем опытного инженера для развития платформы данных в RegTech-компании. Нужно строить пайплайны на Spark и dbt, оркестрировать их в Dagster, обеспечивать надёжность и качество данных. Предлагают удалёнку, гибкий график и работу в стратегически важном направлении.
Старший Site Reliability Engineer
~2 257 877 ₸ оценка
Ищут старшего SRE-инженера для повышения надежности продакшена и автоматизации процессов. Требуется опыт в DevOps/SRE, работа в распределенной удаленной команде. Предлагают удаленную работу.
Архитектор платформы качества (Quality Gate Platform Engineer)
~2 257 877 ₸ оценка
Kooltra, канадский финтех, ищет архитектора платформы качества для построения системы автоматической верификации кода, включая тестирование, CI/CD и наблюдаемость. Требуется глубокий опыт с property-based тестированием, TDD, Kotlin/TypeScript, Kubernetes и AWS. Роль удалённая, полная занятость, предполагает лидерство в инженерной культуре.