Старший SRE инженер
Ищут старшего SRE-инженера для работы над крупномасштабной облачной инфраструктурой на Kubernetes (GCP/AWS). Вы будете автоматизировать операции, улучшать наблюдаемость и процессы развертывания, а также участвовать в расследовании инцидентов. Требуется 5+ лет опыта в SRE/DevOps, сильные навыки Python и опыт с Kubernetes.
Зарплата не указана — оценили по рынку
На основе 114 похожих вакансий за 90 дней.
Что предстоит делать
Я буду сотрудничать с инженерными командами по всему миру, чтобы повысить надежность, масштабируемость и операционное совершенство нашей облачной платформы. Как Senior SRE, вы будете руководить инициативами по обеспечению надежности, основанными на инженерных подходах, создавая автоматизацию, улучшая процессы развертывания, развивая наблюдаемость и обеспечивая операционное совершенство в нашей производственной среде.
- Инженерия надежности — проектирование и внедрение решений, повышающих надежность, доступность и масштабируемость нашей производственной платформы, а также упреждающее выявление и устранение операционных рисков.
- Автоматизация и платформенная инженерия — создание внутренних инструментов и автоматизации, которые устраняют ручную операционную работу, повышают продуктивность инженеров и оптимизируют производственные рабочие процессы.
- Наблюдаемость — улучшение мониторинга, алертинга, дашбордов и видимости производственной среды, а также реализация инициатив, снижающих усталость от алертов, улучшающих обнаружение инцидентов и укрепляющих операционную аналитику.
- Производственные развертывания — проектирование, улучшение и поддержка процессов производственного развертывания с использованием современных стратегий релизов, таких как Canary, Blue/Green и Feature Flags, для обеспечения безопасных и надежных релизов.
- Производственная надежность и реагирование на инциденты — руководство расследованием и устранением критических производственных инцидентов, проведение анализа корневых причин и внедрение долгосрочных превентивных улучшений, повышающих устойчивость платформы и снижающих повторяемость проблем.
- On-Call и операционное совершенство — участие в on-call ротации команды, обеспечение надежной производственной эксплуатации. Реагирование на критические инциденты, сотрудничество с инженерными командами во время сбоев сервисов, а также внедрение инженерных улучшений, автоматизации и операционных лучших практик, снижающих операционную нагрузку и предотвращающих будущие инциденты.
- Облако и инфраструктура — проектирование, поддержка и улучшение нашей облачной платформы на базе Kubernetes, CI/CD пайплайнов и производственной инфраструктуры, работающей на GCP и AWS.
- Инженерное партнерство — тесное сотрудничество с инженерами-программистами, DevOps, DBA и продуктовыми командами для повышения надежности на протяжении всего жизненного цикла разработки ПО и продвижения лучших практик SRE.
Что ждём от вас
- 5+ лет опыта в Site Reliability Engineering, Platform Engineering, DevOps или Infrastructure Engineering.
- Практический опыт эксплуатации Kubernetes в производственных средах.
- Уверенный опыт работы с публичными облачными платформами (GCP или AWS).
- Сильные навыки программирования и написания скриптов (предпочтительно Python; Go или Bash — плюс).
- Опыт проектирования и создания автоматизации и внутренних инженерных инструментов.
- Опыт работы с CI/CD пайплайнами и современными методологиями развертывания.
- Практический опыт работы с платформами наблюдаемости, такими как Datadog, Prometheus или Grafana.
- Глубокое понимание Linux, сетей, распределенных систем и cloud-native архитектур.
- Отличные навыки поиска и устранения неисправностей, отладки и анализа корневых причин.
- Сильные коммуникативные навыки и опыт сотрудничества с географически распределенными инженерными командами.
- Преимущества
- Опыт работы с Infrastructure as Code (Terraform, Ansible и т.д.).
- Опыт работы с системами обмена сообщениями и распределенными технологиями, такими как Kafka, Pub/Sub или Redis.
- Опыт поддержки современных стратегий развертывания, таких как Canary, Blue/Green или Feature Flags.
- Знакомство с OpenTelemetry и современными инструментами наблюдаемости.
- Понимание принципов Site Reliability Engineering, включая SLI, SLO и error budgets.
- Опыт работы в крупномасштабных SaaS производственных средах.
- Соответствующие облачные сертификаты или сертификаты Kubernetes (GCP, AWS, CKA, CKAD).
- Почему стоит присоединиться к нам?
- Присоединяйтесь к команде, где Site Reliability Engineering рассматривается как инженерная дисциплина, а не просто операционная функция. Вы будете работать с крупномасштабной облачной инфраструктурой, обслуживающей корпоративных клиентов, создавая автоматизацию, улучшая наблюдаемость и позволяя инженерным командам безопасно и надежно поставлять ПО.
- Вы будете сотрудничать с глобальной SRE-организацией, используя современные cloud-native технологии, Kubernetes, распределенные системы и крупномасштабные SaaS-нагрузки. У вас будет возможность руководить значимыми инициативами по надежности, влиять на инженерные лучшие практики и решать сложные производственные задачи, которые напрямую улучшают опыт как клиентов, так и инженерных команд.
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Похожие вакансии
6 вакансийSenior Infrastructure Engineer
~2 257 877 ₸ оценка
Вакансия DevOps-инженера в компании Dataiku: проектирование и управление платформами данных, автоматизация инфраструктуры, облачные технологии и Linux. Требуется опыт работы с инфраструктурой и умение сотрудничать с командами.
Системный администратор / DevOps-Инженер
~280 000 – 550 000 ₸ оценка
Вакансия системного администратора в Национальном Банке Казахстана: проектирование и поддержка инфраструктуры резервных ЦОД, настройка репликации, отказоустойчивости, администрирование серверов и СХД. Требуется опыт от 5 лет, глубокие знания Linux, VMware, систем хранения данных. Предлагают стабильную работу, соцпакет и профессиональное развитие.
DevOps инженер (CI/CD)
~2 257 877 ₸ оценка
Инженер DevOps будет заниматься проектированием и поддержкой CI/CD платформ, автоматизацией и контейнеризацией, а также поддержкой Kubernetes. Требуется опыт в DevOps и CI/CD, а также умение обучать коллег. Вакансия предполагает работу в облачной и локальной среде.
Senior DevOps Engineer
~2 257 877 ₸ оценка
Вакансия разработчика программного обеспечения для клинических исследований. Требуется опыт разработки и эксплуатации решений, знание облачных технологий и умение работать в международной команде. Предлагается работа в регулируемой среде с фокусом на надежность и инновации.
Инженер по надежности (SRE)
~2 257 877 ₸ оценка
Инженер по надежности будет отвечать за разработку и внедрение SLI/SLO для компонентов платформы безопасности, а также за создание систем мониторинга и оповещения. Требуется опыт в DevOps/SRE и понимание практик обеспечения надежности. Работа предполагает тесное взаимодействие с командами разработки.
Principal Platform Engineer (Capacity)
Вакансия для инженера, который будет управлять и оптимизировать облачные ресурсы, обеспечивая масштабирование Elastic Cloud и Serverless нагрузок. Требуется опыт работы с облачными платформами, разработка моделей емкости и внедрение автомасштабирования. Предполагается сотрудничество с командами платформенной инженерии и анализ метрик производительности.