Старший SRE / DevOps инженер
Ищем старшего SRE/DevOps инженера для управления GPU-облачной платформой: отвечать за надежность, автоматизацию и эксплуатацию подсистем, вести инциденты и наставничать коллег. Требуется 6+ лет опыта, глубокие знания Linux, Kubernetes, сетей и IaC. Предлагают удаленную работу, высокую автономию и участие в развитии AI-инфраструктуры.
Зарплата не указана — оценили по рынку
На основе 158 похожих вакансий за 90 дней.
Что предстоит делать
##### О Нашем Клиенте Наш клиент — это neocloud, строящий специализированную GPU-инфраструктуру для AI-нагрузок. Они эксплуатируют кластеры большого масштаба, обеспечивающие обучение и инференс для одних из самых требовательных AI-заказчиков на рынке, и стремительно расширяются. Их инфраструктура работает на ускорителях NVIDIA и AMD, фабриках InfiniBand и высокоскоростного Ethernet, а производственный стек охватывает bare-metal provisioning, Kubernetes и OpenStack. Команда небольшая, состоит из senior-специалистов и работает быстро. Люди, которым комфортно в такой среде, владеют задачами от начала до конца и принимают решения при неполной информации. Роль Наш клиент нанимает Senior SRE / DevOps Engineer, который будет владеть ключевыми компонентами GPU-облачной платформы от начала до конца, включая надежность, автоматизацию и эксплуатационную пригодность систем, превращающих стойки с GPU в клиентоориентированную инфраструктуру. Это роль индивидуального исполнителя с высокой степенью автономии. Вы будете полностью владеть подсистемами, руководить инцидентами на бридже, создавать автоматизацию, устраняющую рутинную работу, и наставлять инженеров среднего и младшего уровня. Вы будете отлаживать системы в продакшене, писать runbook, которого не существовало вчера, и оставлять системы с лучшей инструментацией, чем они были до вас. Ожидается участие в общей дежурной ротации (on-call). Чем Вы Будете Владеть Владение подсистемами. Полное владение надежностью, производительностью и эксплуатационной пригодностью ключевых подсистем платформы. Реагирование на инциденты. Руководство живыми инцидентами совместно с платформенными и сетевыми инженерами; подготовка RCA и доведение корректирующих мероприятий до завершения. Автоматизация и IaC. Создание и поддержка Ansible, Terraform и аналогичных инструментов для снижения рутинной работы и кодификации операционных знаний. Наблюдаемость. Определение того, как должны выглядеть качественные мониторинг и наблюдаемость для систем, которыми вы владеете, с использованием таких инструментов, как Prometheus, Grafana, Checkmk и Loki, а также устранение низкоинформативных алертов. Операционная готовность. Участие в вводе в эксплуатацию новых кластеров и дата-центров совместно с командами Data Center Build и Networking. Наставничество. Повышение уровня инженеров среднего и младшего звена через ревью, парное программирование и коучинг во время дежурств. Что Мы Ищем Обязательные требования 6+ лет опыта в SRE, production engineering, DevOps или эксплуатации инфраструктуры. Уверенное владение Linux в масштабе, включая отладку реальных сетевых, дисковых и проблем производительности в продакшене. Сильный операционный опыт работы с Kubernetes — вы понимаете, что ломается в масштабе, а не просто умеете писать манифесты. Твердые основы сетей, включая L2/L3 и основы BGP. Свободное владение современными инструментами автоматизации и Infrastructure as Code, такими как Ansible, Terraform или их эквивалентами, с явной склонностью к кодификации операционных знаний. Подтвержденный опыт участия в on-call ротациях, руководства инцидентами и создания post-mortem, которым доверяют инженеры. Четкая, прямая письменная коммуникация. Значительная часть работы выполняется асинхронно. Строго желательно Опыт работы с GPU или HPC-инфраструктурой, включая такие технологии, как NCCL, InfiniBand или DCGM — или сильное желание быстро их освоить. Опыт работы с OpenStack или bare-metal provisioning. Знакомство со стеками наблюдаемости, такими как Prometheus, Grafana и Checkmk, а также четкая позиция по поводу эффективного мониторинга. Предыдущий опыт работы в neocloud, облачном провайдере или вендоре инфраструктуры, где время безотказной работы напрямую влияло на выручку. Как Работает Команда Наш клиент работает в формате remote-first в часовых поясах US, LATAM и EU, с сильной операционной культурой. Команда фиксирует все в письменном виде — решения, архитектуру, runbook и post-mortem — и ценит эти артефакты выше лишних встреч. AI-инструменты активно используются в повседневной работе, и ожидается, что инженеры будут комфортно с ними работать и находить способы получать от них дополнительную выгоду. Команда выпускает продукт, отлаживает и итерирует. Они избегают добавления ненужных процессов вокруг проблем, которые просто нужно решить. Они ценят спокойствие, а не показную срочность, и осознанно защищают время для глубокой работы и сон. AI как Мультипликатор Силы AI-ассистируемые рабочие процессы — это норма, а не исключение. Текущие операционные процессы включают такие инструменты, как Claude Code для SRE-операций и MCP-серверы, предоставляющие доступ к таким системам, как Jira, NetBox и Checkmk. В этой роли вы будете: Использовать кодинг-агентов для написания и рефакторинга автоматизации, а также AI-ассистируемую валидацию для повышения надежности изменений. Использовать AI для помощи в триаже логов и метрик во время инцидентов, обобщения таймлайнов и подготовки черновиков RCA. Помогать превращать системы, которыми вы владеете, в знания, доступные для AI, через качественную документацию, понятные схемы и полезные MCP-поверхности. Как Выглядит Успех Первые 30 дней Войти в курс дела по стеку и взять на себя ответственность как минимум за одну подсистему. Присоединиться к on-call ротации и принять участие в достаточном количестве инцидентов в качестве наблюдателя, чтобы стать эффективным на бридже. Первые 90 дней Внедрить значимые улучшения в автоматизацию или надежность систем, которыми вы владеете. Провести как минимум один инцидент в роли технического владельца и подготовить четкий, применимый на практике RCA. Первые 12 месяцев Системы, которыми вы владеете, стали заметно надежнее и требуют меньше рутинной работы, чем до вашего прихода. Повторяющиеся инциденты в вашей зоне ответственности сократились, с четкой привязкой к автоматизации, защитным механизмам или улучшениям надежности. Вы наставили как минимум одного инженера среднего или младшего звена до более сильного технического владения.
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Похожие вакансии
6 вакансий
Фриланс DevOps специалист
~1 787 088 – 3 449 477 ₸ оценка
Американская eCommerce-студия Peachy ищет опытного DevOps-специалиста на фриланс с частичной занятостью. Нужно поддерживать и улучшать инфраструктуру, настраивать CI/CD, работать с AWS и Azure. Требуется 4+ года опыта и английский уровня Upper-Intermediate. Работа полностью удалённая, с гибким графиком.
Фриланс DevOps специалист
~1 787 088 – 3 449 477 ₸ оценка
Американская eCommerce студия Peachy ищет фриланс DevOps специалиста для улучшения инфраструктуры, настройки серверов и CI/CD пайплайнов в AWS и Azure. Требуется 4+ года опыта, удаленная работа с гибким графиком.
Старший DevOps инженер
~1 787 088 – 3 449 477 ₸ оценка
Старший DevOps инженер с опытом разработки на Go и Python для управления облачной инфраструктурой, автоматизации и CI/CD. Требуется 6+ лет в IT и 3+ года в разработке, знание Kubernetes, Terraform, облаков. Предлагают удаленную работу по B2B-контракту, медстраховку и рост до тимлида.
DevOps инженер
~1 787 088 – 3 449 477 ₸ оценка
Международная финтех-компания TODA Pay ищет DevOps-инженера с опытом от 4 лет. Вы будете проектировать и поддерживать облачную инфраструктуру (AWS/GCP), автоматизировать CI/CD, работать с Docker и Kubernetes, а также с bare metal серверами. Предлагают полную удаленку, гибкий график, 24 дня отпуска и бюджет на обучение.
Старший DevOps инженер
~1 787 088 – 3 449 477 ₸ оценка
Старший DevOps инженер для управления инфраструктурой Mailtrap на AWS и руководства проектом по частичному переносу нагрузок на собственные серверы для оптимизации затрат. Требуется глубокий опыт с AWS, Terraform, CI/CD, Docker и Linux-сетями, а также знание английского на уровне Advanced. Предлагается полная удалёнка, конкурентная зарплата и отличные бенефиты.
PostgreSQL DBA (Database Administrator)
~1 787 088 – 3 449 477 ₸ оценка
Компания Systeme.io ищет опытного администратора баз данных PostgreSQL для поддержки высоконагруженной SaaS-платформы. Основные задачи — администрирование, оптимизация производительности, обеспечение отказоустойчивости и автоматизация. Требуется опыт от 3 лет, знание Linux, SQL, облачных технологий и инструментов мониторинга. Предлагается удаленная работа, гибкий график и компенсации.