Data Engineer
Ищем опытного Data Engineer для работы над платформой данных в компании Simulmedia (США). Вы будете строить и поддерживать пайплайны обработки больших данных, моделировать данные и разрабатывать сервисы на Python. Требуется глубокое знание Python, SQL, Spark/Databricks и Airflow, а также опыт работы с AWS. Работа удалённая из Украины, с графиком, пересекающимся с американскими командами.
Зарплата не указана — оценили по рынку
На основе 302 похожих вакансий за 90 дней.
Что предстоит делать
<p>Simulmedia ищет опытного и динамичного <strong>Data Engineer</strong> с любознательным и творческим складом ума для присоединения к нашей команде <strong>Data Services</strong>. Идеальный кандидат должен иметь сильный опыт в <strong>Python, SQL и работе с масштабными конвейерами данных</strong>. Это возможность присоединиться к команде выдающихся инженеров, дата-сайентистов, продакт-менеджеров и дизайнеров, которые стремятся создать самую передовую платформу для ТВ и стриминговой рекламы на рынке. В роли <strong>Data Engineer</strong> вы будете проектировать, создавать и эксплуатировать платформу данных, которая обеспечивает работу компании: конвейеры, которые принимают и преобразуют очень большие наборы данных от внешних партнеров, модели данных, к которым обращается вся компания, и сервисы, которые делают эти данные доступными для внутренних продуктов. Вы будете работать в команде, которая дает возможность другим командам эффективно использовать наш огромный объем данных. Используя большое разнообразие технологий и инструментов, вы будете решать сложные технические проблемы и создавать решения, чтобы сделать наши конвейеры надежными и отказоустойчивыми, а наши данные легкодоступными по всей компании.</p><p><strong>Локация: обязательно Украина.</strong> Наши офисы находятся в Киеве и Львове. Команды расположены в Киеве и Львове и в основном работают удаленно с occasional офлайн-встречами.</p><p><strong>Обязанности:</strong></p><ul><li>Проектирование и создание пакетных конвейеров данных, которые принимают, проверяют и преобразуют наборы данных с миллиардами строк от внешних поставщиков данных и внутренних систем</li><li>Моделирование сложных реальных данных: размерные модели, справочные данные и временные данные, атрибуты которых меняются со временем (например, медленно меняющиеся измерения), и безопасное развитие этих моделей по мере изменения схем и семантики вышестоящих источников</li><li>Разработка и эксплуатация рабочих нагрузок на нашей lakehouse-платформе (Databricks / Spark / Delta) и нашем хранилище данных (Redshift), включая миграцию существующих конвейеров из хранилища в lakehouse</li><li>Оркестрация конвейеров с помощью Airflow: планирование, зависимости, повторные попытки, бэкфиллы и оповещения</li><li>Доказательство корректности, а не только завершенности: разработка проверок паритета и запросов сверки при замене существующего конвейера, выполнение больших исторических бэкфиллов и расследование расхождений в данных вплоть до уровня строк</li><li>Создание и поддержка сервисов на Python и REST API, которые предоставляют данные внутренним продуктам</li><li>Оптимизация производительности и затрат: настройка запросов, проектирование таблиц, управление рабочими нагрузками и правильный подбор вычислительных ресурсов</li><li>Полная ответственность за результат: мониторинг production-конвейеров, участие в разборе инцидентов и анализе первопричин, а также укрепление систем, чтобы одна и та же ошибка не повторялась дважды</li><li>Межфункциональное сотрудничество с продакт-менеджерами, дата-сайентистами и заинтересованными сторонами по всей компании для реализации дорожной карты продукта</li><li>Работа в Agile-команде, которая регулярно выпускает передовые новые функции</li><li>Высокая степень ответственности и свобода экспериментировать с новыми технологиями для улучшения нашего программного обеспечения</li></ul><p><strong>Требования:</strong></p><ul><li>Степень бакалавра в области компьютерных наук, компьютерной инженерии, смежной технической области или эквивалентный практический опыт</li><li>Более 7 лет опыта работы в качестве data engineer</li><li>Свободное владение Python и использование его в качестве основного языка разработки в последние годы</li><li>SQL на экспертном уровне: уверенное написание, чтение и настройка сложных аналитических запросов к очень большим таблицам, а также отладка причин расхождения двух результирующих наборов данных</li><li>Практический опыт работы с распределенной платформой обработки данных (Spark/Databricks строго приветствуется; EMR, Snowflake или BigQuery также релевантны) и с колоночным хранилищем данных (Redshift, Snowflake, BigQuery, ClickHouse и т.д.)</li><li>Способность проектировать сложные модели данных: нормализованные, размерные и временные (медленно меняющиеся измерения, записи с датами вступления в силу, корректность на определенный момент времени)</li><li>Опыт работы с инструментами оркестрации рабочих процессов (Airflow или аналоги): создание DAG, управление зависимостями и выполнение бэкфиллов</li><li>Опыт интеграции сторонних фидов данных: обработка изменений схем, задержек или отсутствия поставок, дефектов качества данных поставщика и версионированных справочных данных</li><li>Опыт создания REST-сервисов на Python (FastAPI, Flask и т.д.)</li><li>Опыт разработки, поддержки и отладки проблем в больших серверных кодовых базах</li><li>Рабочие знания AWS (S3, IAM, ECS или аналогичные вычисления) и Docker</li><li>Хорошее знание лучших практик разработки и тестирования (модульные тесты, интеграционные тесты, код-ревью, CI/CD)</li><li>Желание брать на себя высокий уровень ответственности за то, над чем вы работаете</li><li>Способность быстро учиться новому, поддерживать высокую планку качества и быть прагматичным</li><li>Необходимость уметь общаться с командами, базирующимися в США</li><li>Опыт работы с Delta Lake / медальонной lakehouse-архитектурой будет плюсом</li><li>Опыт миграции устаревших конвейеров между платформами со строгими требованиями паритета будет плюсом</li><li>Опыт работы с данными рекламной, медийной или измерительной индустрии будет плюсом</li><li>Способность эффективно общаться с командами, базирующимися в США, и работать <strong>с 11:00 до 20:00 EEST (11:00 — 20:00)</strong>.</li></ul><p><strong>Наш технологический стек:</strong></p><ul><li>Почти все, что мы запускаем, работает на AWS (S3, ECS, EMR, RDS и другое)</li><li>Python — наш основной язык; SQL используется повсеместно</li><li>Databricks (Spark, Delta Lake) — наша lakehouse-платформа; Redshift и Postgres — наши хранилища и операционные базы данных</li><li>Airflow оркестрирует наши конвейеры</li><li>Docker для упаковки; GitHub Actions и Jenkins для CI/CD</li><li>Grafana, Sentry и OpenSearch для наблюдаемости</li><li>Наборы данных измеряются миллиардами строк</li></ul><p><strong>Процесс собеседования:</strong></p><ol><li><strong>Предварительный скрининг (30 минут)</strong></li><li><strong>Техническое собеседование (1 час)</strong></li><li><strong>Системный дизайн (1,5 часа)</strong></li><li><strong>Продуктовое собеседование (30 минут)</strong></li><li><strong>Оффер.</strong></li></ol> <div> <a href="https://jobs.dou.ua/companies/simulmedia/vacancies/367891/#reply-btn-id">Откликнуться на вакансию</a> </div>
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Ещё в Simulmedia
4 активные вакансии в компании
Старший Backend инженер
Ищем старшего бэкенд-инженера для разработки и поддержки платформы телевизионной рекламы. Основной стек — Ruby (Roda), также потребуется TypeScript/Node.js для API-слоя. Требуется опыт работы с микросервисами, облаком AWS и инструментами мониторинга. Предлагают удаленную работу в Украине, участие в крупном distributed-проекте и современный технологический стек.
Старший Full Stack инженер
Старший Full Stack разработчик для продукта в сфере телевизионной рекламы. Нужно развивать фронтенд и бэкенд на React, Next.js, TypeScript, tRPC, разворачивать на Vercel. Требуется 5+ лет опыта, глубокое знание TypeScript и React, опыт с SSR/SSG и тестированием. Работа удаленно из Украины (Киев или Львов), график с 11:00 до 20:00 EEST.
Middle Data Scientist
Компания Simulmedia ищет Middle Data Scientist для работы над моделями машинного обучения, которые улучшают таргетинг и оптимизацию рекламы. Требуется опыт 2-4 года, владение Python, SQL и scikit-learn. Предлагается удаленная работа с возможностью посещения офиса в Киеве или Львове.
Похожие вакансии
6 вакансий
Аналитик в команду динамического ценообразования
~2 668 363 – 3 586 279 ₸ оценка
Ищем сильного аналитика для развития инструментов динамического ценообразования в каршеринге CityDrive. Нужен опыт проведения сложных экспериментов, знание Python, SQL и Git, а также развитое экономическое мышление. Предлагают удалённую работу, официальное оформление, ДМС и другие бонусы.
Продуктовый владелец AI-платформы Alf
~2 668 363 – 3 586 279 ₸ оценка
Продуктовый владелец AI-платформы Alf в компании ZONE3000 (партнер Namecheap). Роль сочетает управление платформой и развитие AI-функциональности, требует опыта в продукт-менеджменте технических продуктов и работы с AI. Предлагают удаленную работу, гибкий график, обучение и конкурентную зарплату.
Старший инженер данных (Snowflake, DBT)
Вакансия для опытного инженера данных, который будет проектировать и строить высокопроизводительные конвейеры данных на Snowflake с использованием DBT. Требуется глубокое знание Snowflake, SQL и Airflow. Компания предлагает удаленную работу, 18 оплачиваемых отпускных дней, обучение и медицинскую страховку.
Ведущий аналитик больших данных
~2 668 363 – 3 586 279 ₸ оценка
Ищем ведущего аналитика больших данных для работы над социально значимыми проектами по защите детей в интернете. Требуется опыт от 4 лет, экспертное знание SQL (ClickHouse, PostgreSQL, Greenplum) и Python (Pandas, NumPy, Scikit-learn). Предлагаем удаленный или гибридный формат, официальное трудоустройство и возможности для профессионального роста.
MLOps инженер (Старший)
Ищем старшего MLOps инженера для работы в исследовательской команде, занимающейся морским ИИ. Вы будете отвечать за инфраструктуру и процессы полного жизненного цикла моделей машинного обучения: от исследований до продакшена и мониторинга. Требуется опыт с ML/DL, CI/CD, облачными платформами (AWS/Azure/GCP), Python, Java и инструментами вроде MLFlow и PyTorch. Предлагают гибкий график, медстраховку и конкурентоспособную зарплату.
AI инженер (Старший или сильный Middle)
~2 668 363 – 3 586 279 ₸ оценка
Компания Automat-it ищет опытного AI инженера для создания и внедрения production-систем генеративного AI на AWS. Вам предстоит разрабатывать RAG пайплайны, агентные решения и LLM-сервисы, работая напрямую с командами стартапов. Требуются глубокие знания AWS, Python и опыт построения GenAI систем в продакшене.