Инженер технической поддержки ML-платформы
Поддержка ML-платформы на Kubernetes для крупного российского банка. Нужен опыт работы с Kubernetes, мониторингом (Prometheus, Grafana) и скриптование (Python/Bash). Предлагают удаленную работу, официальное трудоустройство и ДМС.
Зарплата не указана — оценили по рынку
На основе 284 похожих вакансий за 90 дней.
Что предстоит делать
Навыки: Kubernetes, Prometheus, Grafana. Квалификация: Middle. Специализации: Инженер технической поддержки. ## ## О компании и команде Мы набираем IT специалистов в большую команду для работы на проектах для крупного и динамичного российского банка. Команда будет занимать разработкой инструментов и процессов для реализации единой платформы для разработки, развертывания и эксплуатации решений на основе LLM, а так же агентской платформы для работы с ИИ-агентами. Проект направлен на создание единой технологической платформы для разработки, развертывания и эксплуатации решений на основе больших языковых моделей с использованием инфраструктуры АС «Суперкомпьютер». Ключевая задача - переход от точечных пилотов к промышленному внедрению ИИ с централизацией управления безопасностью, качеством и стоимостью, а также настроить приоритизацию клиентских запросов. Архитектура платформы четырехуровневая: инфраструктурный слой (GPU-кластер), слой оркестрации и LLMOps, слой знаний (RAG), агентская платформа. ## Задачи Поддержка ML-платформы и Kubernetes (Основной фокус): • Эксплуатация платформы: o Мониторинг состояния сервисов инференса в Kubernetes (доступность подов, потребление ресурсов, перезапуски). o Диагностика проблем с запуском контейнеров моделей (ошибки инициализации, нехватка памяти, проблемы с зависимостями). • Мониторинг и инциденты: o Настройка дашбордов для отслеживания метрик качества сервисов; o Первичная реакция на инциденты: сбор логов, анализ трассировок, эскалация разработчикам (L3) при невозможности устранения в течение 15-30 минут; o Анализ причин деградации производительности моделей (дрейф данных, проблемы инфраструктуры); • Поддержка пользователей (Data Scientists / Разработчики): o Консультирование по использованию API платформы для деплоя и управления моделями; o Обучение работе с инструментами платформы (CLI, SDK, веб-интерфейс); o Создание инструкций и FAQ по типовым задачам развертывания; • Безопасность и доступы: o Управление доступом к функциям платформы согласно политикам безопасности; o Контроль соблюдения регламентов при работе с данными; Поддержка векторной БД Milvus (Опционально ): • Управление доступом: o Создание баз данных и ролей в Milvus и назначение прав; • Мониторинг Milvus: o Поддержка дашбордов Grafana для векторной БД (метрики: задержка поиска, загрузка CPU узлов query, использование диска, статус лидера etcd, отставание Kafka); o Реагирование на алерты (критические: остановка узлов, потеря лидера etcd, место на диске < 10%; предупреждения: задержка поиска > 5с, лаг Kafka > 1000). ## Ожидания от кандидата - Опыт использования Kubernetes (диагностика подов, работа с kubectl, понимание networking и storage); - Понимание принципов работы ML-моделей (инференс, API моделей, форматы данных); - Опыт настройки мониторинга и алертинга (Prometheus, Grafana, ELK); - Навыки скриптования (Python/Bash) для автоматизации рутинных задач; - Умение работать с пользователями и писать техническую документацию. ## Условия работы - Официальное трудоустройство по ТК РФ в аккредитованную IT компанию, белая заработная плата; - Удаленная формат работы; - ДМС после испытательного срока - И многое другое.
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Похожие вакансии
6 вакансий
Системный администратор
~1 327 359 ₸ оценка
Ищем опытного системного администратора для поддержки и развития масштабной ИТ-инфраструктуры сети мебельных гипермаркетов Hoff. В задачи входит администрирование Windows и Linux серверов, виртуализация vSphere, мониторинг и автоматизация. Предлагаем удаленную работу, стабильный доход и возможности профессионального роста.
Администратор баз данных Clickhouse/Kafka
~1 327 359 ₸ оценка
Ищем администратора баз данных Clickhouse и Kafka для работы в банковской IT-команде. Нужен опыт администрирования этих систем от года, навыки работы с Linux и понимание архитектуры СУБД. Предлагаем развитие в крупной компании с современными технологиями.
DevOps инженер
~1 327 359 ₸ оценка
DevOps инженер для построения и поддержки CI/CD пайплайнов в финтех-проекте. Нужен опыт с GitHub Actions, Docker, JavaScript/TypeScript, C++/CMake, Linux и IaC. Предлагают удаленную работу, гибкий график и возможности для роста.
DevOps/Network Engineer
~1 327 359 ₸ оценка
Domino's Pizza шукає DevOps/Network Engineer для роботи з AWS та Kubernetes у production. Потрібен досвід побудови CI/CD, контейнеризації та адміністрування мереж. Пропонується повна віддалена робота з України.
Platform Engineer
~1 327 359 ₸ оценка
Ищем Platform Engineer для построения и поддержки единой инфраструктуры на VPS. Нужно настраивать CI/CD, мониторинг, бэкапы и безопасность, а также разрабатывать AI-стандарты и проводить технические ревью. Предлагается работа над внутренней платформой для ускорения разработки.
Системный администратор / DevOps
~1 327 359 ₸ оценка
Поддержка и развитие IT-инфраструктуры международной команды: администрирование Linux, управление виртуализацией и контейнерами, настройка мониторинга и сетей. Требуется опыт с Proxmox, Docker, Grafana, Prometheus. Удаленная работа.