Перейти к содержимому
Lumnix
L
Lumnix
2

Старший SRE / DevOps инженер

Ищем старшего SRE/DevOps инженера для управления GPU-облачной платформой: отвечать за надежность, автоматизацию и эксплуатацию подсистем, вести инциденты и наставничать коллег. Требуется 6+ лет опыта, глубокие знания Linux, Kubernetes, сетей и IaC. Предлагают удаленную работу, высокую автономию и участие в развитии AI-инфраструктуры.

senior удалённо ~1 787 088 – 3 449 477 ₸
Языки: English · Intermediate
salary intelligence

Зарплата не указана — оценили по рынку

На основе 158 похожих вакансий за 90 дней.

оценка p25–p75
1 787 088 – 3 449 477 ₸
медиана: 2 680 900 ₸
Хотите увидеть распределение по грейдам и городам? Зарплаты DevOps Калькулятор зарплат
Вакансии в Telegram-канале
Свежие вакансии Каждый день
Подписаться
??%
Match Score
Войдите и создайте резюме
Войти
описание

Что предстоит делать

##### О Нашем Клиенте Наш клиент — это neocloud, строящий специализированную GPU-инфраструктуру для AI-нагрузок. Они эксплуатируют кластеры большого масштаба, обеспечивающие обучение и инференс для одних из самых требовательных AI-заказчиков на рынке, и стремительно расширяются. Их инфраструктура работает на ускорителях NVIDIA и AMD, фабриках InfiniBand и высокоскоростного Ethernet, а производственный стек охватывает bare-metal provisioning, Kubernetes и OpenStack. Команда небольшая, состоит из senior-специалистов и работает быстро. Люди, которым комфортно в такой среде, владеют задачами от начала до конца и принимают решения при неполной информации. Роль Наш клиент нанимает Senior SRE / DevOps Engineer, который будет владеть ключевыми компонентами GPU-облачной платформы от начала до конца, включая надежность, автоматизацию и эксплуатационную пригодность систем, превращающих стойки с GPU в клиентоориентированную инфраструктуру. Это роль индивидуального исполнителя с высокой степенью автономии. Вы будете полностью владеть подсистемами, руководить инцидентами на бридже, создавать автоматизацию, устраняющую рутинную работу, и наставлять инженеров среднего и младшего уровня. Вы будете отлаживать системы в продакшене, писать runbook, которого не существовало вчера, и оставлять системы с лучшей инструментацией, чем они были до вас. Ожидается участие в общей дежурной ротации (on-call). Чем Вы Будете Владеть Владение подсистемами. Полное владение надежностью, производительностью и эксплуатационной пригодностью ключевых подсистем платформы. Реагирование на инциденты. Руководство живыми инцидентами совместно с платформенными и сетевыми инженерами; подготовка RCA и доведение корректирующих мероприятий до завершения. Автоматизация и IaC. Создание и поддержка Ansible, Terraform и аналогичных инструментов для снижения рутинной работы и кодификации операционных знаний. Наблюдаемость. Определение того, как должны выглядеть качественные мониторинг и наблюдаемость для систем, которыми вы владеете, с использованием таких инструментов, как Prometheus, Grafana, Checkmk и Loki, а также устранение низкоинформативных алертов. Операционная готовность. Участие в вводе в эксплуатацию новых кластеров и дата-центров совместно с командами Data Center Build и Networking. Наставничество. Повышение уровня инженеров среднего и младшего звена через ревью, парное программирование и коучинг во время дежурств. Что Мы Ищем Обязательные требования 6+ лет опыта в SRE, production engineering, DevOps или эксплуатации инфраструктуры. Уверенное владение Linux в масштабе, включая отладку реальных сетевых, дисковых и проблем производительности в продакшене. Сильный операционный опыт работы с Kubernetes — вы понимаете, что ломается в масштабе, а не просто умеете писать манифесты. Твердые основы сетей, включая L2/L3 и основы BGP. Свободное владение современными инструментами автоматизации и Infrastructure as Code, такими как Ansible, Terraform или их эквивалентами, с явной склонностью к кодификации операционных знаний. Подтвержденный опыт участия в on-call ротациях, руководства инцидентами и создания post-mortem, которым доверяют инженеры. Четкая, прямая письменная коммуникация. Значительная часть работы выполняется асинхронно. Строго желательно Опыт работы с GPU или HPC-инфраструктурой, включая такие технологии, как NCCL, InfiniBand или DCGM — или сильное желание быстро их освоить. Опыт работы с OpenStack или bare-metal provisioning. Знакомство со стеками наблюдаемости, такими как Prometheus, Grafana и Checkmk, а также четкая позиция по поводу эффективного мониторинга. Предыдущий опыт работы в neocloud, облачном провайдере или вендоре инфраструктуры, где время безотказной работы напрямую влияло на выручку. Как Работает Команда Наш клиент работает в формате remote-first в часовых поясах US, LATAM и EU, с сильной операционной культурой. Команда фиксирует все в письменном виде — решения, архитектуру, runbook и post-mortem — и ценит эти артефакты выше лишних встреч. AI-инструменты активно используются в повседневной работе, и ожидается, что инженеры будут комфортно с ними работать и находить способы получать от них дополнительную выгоду. Команда выпускает продукт, отлаживает и итерирует. Они избегают добавления ненужных процессов вокруг проблем, которые просто нужно решить. Они ценят спокойствие, а не показную срочность, и осознанно защищают время для глубокой работы и сон. AI как Мультипликатор Силы AI-ассистируемые рабочие процессы — это норма, а не исключение. Текущие операционные процессы включают такие инструменты, как Claude Code для SRE-операций и MCP-серверы, предоставляющие доступ к таким системам, как Jira, NetBox и Checkmk. В этой роли вы будете: Использовать кодинг-агентов для написания и рефакторинга автоматизации, а также AI-ассистируемую валидацию для повышения надежности изменений. Использовать AI для помощи в триаже логов и метрик во время инцидентов, обобщения таймлайнов и подготовки черновиков RCA. Помогать превращать системы, которыми вы владеете, в знания, доступные для AI, через качественную документацию, понятные схемы и полезные MCP-поверхности. Как Выглядит Успех Первые 30 дней Войти в курс дела по стеку и взять на себя ответственность как минимум за одну подсистему. Присоединиться к on-call ротации и принять участие в достаточном количестве инцидентов в качестве наблюдателя, чтобы стать эффективным на бридже. Первые 90 дней Внедрить значимые улучшения в автоматизацию или надежность систем, которыми вы владеете. Провести как минимум один инцидент в роли технического владельца и подготовить четкий, применимый на практике RCA. Первые 12 месяцев Системы, которыми вы владеете, стали заметно надежнее и требуют меньше рутинной работы, чем до вашего прихода. Повторяющиеся инциденты в вашей зоне ответственности сократились, с четкой привязкой к автоматизации, защитным механизмам или улучшениям надежности. Вы наставили как минимум одного инженера среднего или младшего звена до более сильного технического владения.

навыки

Стек и инструменты

Поделиться

Подходит ли вам эта вакансия?

Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть

Создать аккаунт PDF-парсинг резюме за 2 минуты

Похожие вакансии

6 вакансий
Peachy
P
Peachy
1 д. назад

Фриланс DevOps специалист

~1 787 088 – 3 449 477 ₸ оценка

Американская eCommerce-студия Peachy ищет опытного DevOps-специалиста на фриланс с частичной занятостью. Нужно поддерживать и улучшать инфраструктуру, настраивать CI/CD, работать с AWS и Azure. Требуется 4+ года опыта и английский уровня Upper-Intermediate. Работа полностью удалённая, с гибким графиком.

DevOps AWS Azure +3
senior удал. dou
Peachy
P
Peachy
1 д. назад

Фриланс DevOps специалист

~1 787 088 – 3 449 477 ₸ оценка

Американская eCommerce студия Peachy ищет фриланс DevOps специалиста для улучшения инфраструктуры, настройки серверов и CI/CD пайплайнов в AWS и Azure. Требуется 4+ года опыта, удаленная работа с гибким графиком.

DevOps AWS Azure +3
senior удал. dj
Corva.AI
C
Corva.AI
1 д. назад

Старший DevOps инженер

~1 787 088 – 3 449 477 ₸ оценка

Старший DevOps инженер с опытом разработки на Go и Python для управления облачной инфраструктурой, автоматизации и CI/CD. Требуется 6+ лет в IT и 3+ года в разработке, знание Kubernetes, Terraform, облаков. Предлагают удаленную работу по B2B-контракту, медстраховку и рост до тимлида.

DevOps Go Python +9
senior удал. dou
T
TODA Pay
1 д. назад

DevOps инженер

~1 787 088 – 3 449 477 ₸ оценка

Международная финтех-компания TODA Pay ищет DevOps-инженера с опытом от 4 лет. Вы будете проектировать и поддерживать облачную инфраструктуру (AWS/GCP), автоматизировать CI/CD, работать с Docker и Kubernetes, а также с bare metal серверами. Предлагают полную удаленку, гибкий график, 24 дня отпуска и бюджет на обучение.

AWS GCP Terraform +7
senior удал. dou
R
Railsware
1 д. назад

Старший DevOps инженер

~1 787 088 – 3 449 477 ₸ оценка

Старший DevOps инженер для управления инфраструктурой Mailtrap на AWS и руководства проектом по частичному переносу нагрузок на собственные серверы для оптимизации затрат. Требуется глубокий опыт с AWS, Terraform, CI/CD, Docker и Linux-сетями, а также знание английского на уровне Advanced. Предлагается полная удалёнка, конкурентная зарплата и отличные бенефиты.

AWS Terraform CI/CD +21
senior удал. dou
Systeme.io
S
Systeme.io
1 д. назад

PostgreSQL DBA (Database Administrator)

~1 787 088 – 3 449 477 ₸ оценка

Компания Systeme.io ищет опытного администратора баз данных PostgreSQL для поддержки высоконагруженной SaaS-платформы. Основные задачи — администрирование, оптимизация производительности, обеспечение отказоустойчивости и автоматизация. Требуется опыт от 3 лет, знание Linux, SQL, облачных технологий и инструментов мониторинга. Предлагается удаленная работа, гибкий график и компенсации.

PostgreSQL DBA Linux +20
senior удал. hh