DevOps инженер (Self-hosted AI inference platform)
Ищем опытного DevOps/SRE инженера для создания и поддержки self-hosted платформы инференса LLM на GPU NVIDIA H100. Нужно 5+ лет опыта с продакшн Kubernetes, опыт с GPU в Kubernetes, сильные навыки Linux и мониторинга. Работа удаленная, распределенная команда, проект на базе Германии, предпочтительно кандидаты из Западной Украины.
Зарплата не указана — оценили по рынку
На основе 90 похожих вакансий за 90 дней.
Что предстоит делать
<p><strong>Роль в одном предложении</strong></p><p>Создание и эксплуатация self-hosted платформы для AI-инференса — Kubernetes, инфраструктура на NVIDIA H100, vLLM, observability, GitOps и надежность продакшена.</p><p><strong>Контекст</strong></p><p>Мы создаем self-hosted платформу для LLM-инференса, работающую на <strong>GPU NVIDIA H100</strong> и bare-metal Kubernetes. Платформа предоставляет vLLM inference-воркеры и OpenAI-совместимый API для внутренних сервисов.</p><p>Управляемого облачного слоя Kubernetes нет — инженер будет работать напрямую с инфраструктурой и владеть платформой от начальной загрузки кластера до производственной эксплуатации.</p><p><strong>Над чем вы будете работать</strong></p><ul><li>Начальная загрузка и поддержка self-hosted кластеров Kubernetes с HA control plane, резервным копированием/восстановлением etcd и обновлениями.</li><li>Настройка и поддержка инфраструктуры NVIDIA GPU, включая GPU Operator, DCGM и стек CUDA/container runtime.</li><li>Настройка разделения и планирования GPU с использованием MPS или time-slicing.</li><li>Развертывание и эксплуатация vLLM inference-воркеров с rolling-обновлениями без даунтайма и корректным завершением соединений.</li><li>Создание мониторинга и алертинга Prometheus/Grafana для SLI инференса, таких как TTFT, глубина очереди, использование KV-cache и уровень отклонений.</li><li>Реализация IaC для bare-metal provisioning и начальной загрузки кластера с использованием Terraform или Pulumi.</li><li>Настройка GitOps-процессов с ArgoCD или Flux для контролируемых раскаток и откатов.</li><li>Настройка API Gateway, token-aware rate limiting, NetworkPolicy и mTLS.</li><li>Создание автоматизации и runbook для производственных инцидентов, связанных с GPU.</li></ul><p><strong>Обязательные требования</strong></p><ul><li><strong>5+ лет в DevOps, Platform Engineering или SRE</strong> с продакшен-Kubernetes.</li><li>Практический опыт работы с <strong>self-hosted Kubernetes</strong> (kubeadm, RKE2 или k3s), включая начальную загрузку, обновления, etcd и HA.</li><li>Практический опыт работы с <strong>NVIDIA GPU в Kubernetes</strong>, GPU Operator/Device Plugin и стеком драйверов CUDA.</li><li>Глубокое понимание разделения и планирования GPU: MPS, time-slicing и многопроцессные нагрузки.</li><li>Сильные навыки администрирования Linux/систем, включая NUMA, huge pages, управление CPU и устранение неполадок на bare-metal.</li><li>Опыт развертывания долгоиграющих или stateful-нагрузок без даунтайма.</li><li>Сильные навыки работы с Prometheus и Grafana, включая recording и alerting rules.</li><li>Опыт работы с <strong>Terraform или Pulumi</strong>.</li><li>Написание скриптов на Bash/Python для автоматизации, проверок здоровья и мониторинга.</li><li>Базовое понимание <strong>метрик и концепций LLM-инференса</strong>: TTFT, пропускная способность токенов, KV-cache и батчинг.</li></ul><p><strong>Желательно</strong></p><ul><li>Опыт работы с <strong>vLLM, Triton Inference Server, KServe</strong> или аналогичными инструментами.</li><li>Продакшен-опыт GitOps с ArgoCD или FluxCD.</li><li>Опыт работы с Kong, Envoy, APISIX или аналогичными API-шлюзами.</li><li>Опыт работы с Vault или External Secrets Operator.</li><li>Сертификаты CKA, CKS или NVIDIA.</li><li>Опыт бенчмаркинга GPU-нагрузок при смешанной модельной нагрузке.</li></ul><p><strong>Технологический стек, с которым вы будете работать</strong></p><p>Kubernetes, NVIDIA H100, NVIDIA GPU Operator, DCGM, CUDA, containerd, vLLM · Prometheus, Grafana · Terraform / Pulumi · ArgoCD / Flux · Linux, Bash, Python · API Gateway, NetworkPolicy, mTLS · Docker, Git, CI/CD.</p><p><strong>Формат работы</strong></p><ul><li>Удаленная распределенная инженерная команда.</li><li>Среда, ориентированная на продакшен, с владением инфраструктурой и стеком инференса.</li><li>Роль предполагает создание платформы с нуля и поддержание ее надежности в продакшене.</li></ul><p><strong>Важно: </strong>Поскольку это проект, базирующийся в Германии, мы в первую очередь ищем кандидатов в Западной Украине, при этом Винница и Львов являются нашими предпочтительными локациями. Другие безопасные западные регионы могут рассматриваться в индивидуальном порядке.</p> <div> <a href="https://jobs.dou.ua/companies/xcubator/vacancies/372402/#reply-btn-id">Откликнуться на вакансию</a> </div>
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Похожие вакансии
6 вакансийDevOps Engineer
~1 856 820 – 3 688 500 ₸ оценка
Шукаємо DevOps інженера з досвідом AWS, Kubernetes, Terraform та CI/CD для української компанії. Потрібно 3+ роки комерційного досвіду, знання Linux, Docker, Helm, моніторингу. Пропонують гнучкий графік, оплачувану відпустку, курси англійської та дружню команду.
SysOps/DevOps инженер (iGaming)
~1 856 820 – 3 688 500 ₸ оценка
Ищем опытного SysOps/DevOps инженера для аудита серверной инфраструктуры и безопасности iGaming проекта. Требуется 3+ года опыта, знание Linux, облачных платформ, CI/CD, IaC, контейнеров и активное использование AI-инструментов. Работа удаленная, полная занятость, долгосрочное сотрудничество.
Инженер по облачной инфраструктуре (Kubernetes, GCP)
~1 856 820 – 3 688 500 ₸ оценка по стеку
Компания LoopMe, занимающаяся AI-рекламой, ищет инженера по облачной инфраструктуре. Вы будете работать с Kubernetes, GCP и автоматизацией, поддерживая высоконагруженные системы. Требуется опыт от 3 лет в DevOps и знание облачных платформ. Предлагают гибкий график и удалённую работу.
DevOps инженер
~1 856 820 – 3 688 500 ₸ оценка
Ищем DevOps-инженера с опытом 5+ лет для поддержки и развития инфраструктуры зарубежных заказчиков. Нужно управлять Linux-серверами, настраивать Nginx, MySQL, Redis, автоматизировать рутину с помощью Ansible и Terraform, внедрять IaC и мониторинг. Предлагают полную удалёнку, гибкий график и высокую зарплату.
DevOps инженер (KVM, OpenStack)
~1 856 820 – 3 688 500 ₸ оценка
Ищут опытного DevOps-инженера для развития IaaS-платформы на базе OpenStack и KVM. Нужны глубокие знания виртуализации, Linux, облаков и автоматизации. Предлагают удаленную работу, гибкий график и возможности для профессионального роста.
Администратор Kubernetes / Инженер Private Cloud (м/ж)
~1 856 820 – 3 688 500 ₸ оценка по стеку
Ищем опытного инженера для администрирования Kubernetes и Private Cloud в немецкой IT-компании, работающей над цифровизацией госсектора. Нужно минимум 5 лет опыта, уверенное владение Kubernetes и Ansible, а также знание немецкого на уровне C1. Предлагают удаленную работу, гибкий график и бюджет на развитие.