Старший Data Engineer
Старший Data Engineer для разработки платформы приема и нормализации больших объемов данных для юридической сферы. Нужен сильный Python, опыт с Spark, Kubernetes, Airflow и проектированием надежных ETL-пайплайнов. Компания предлагает удаленную работу, гибкий график и хороший соцпакет.
Зарплата не указана — оценили по рынку
На основе 216 похожих вакансий за 90 дней.
Что предстоит делать
<p><strong>О компании</strong> <br>Binariks ищет высокомотивированного и квалифицированного <strong>Senior Data Engineer.</strong> <br>О проекте: это платформа для приема и обработки данных (Ingestion Platform).<br>Кандидат присоединится к команде, которая строит платформу приема данных для юридической / eDiscovery сферы — систему, которая принимает большие объемы как неструктурированных документов, так и структурированных записей из множества различных клиентских систем и превращает их в единую чистую, доступную для поиска модель (нормализует их в каноническую модель данных для последующего поиска и анализа).<br><br><strong>Что мы ищем</strong></p><ul><li>7+ лет практического опыта в области инженерии данных</li><li>Опыт работы с Python. Уверенное владение на продакшн-уровне, включая тестирование, упаковку и типизацию в общей командной кодовой базе</li><li>Проектирование и создание конвейеров данных, которые остаются надежными при росте объемов данных и количества источников</li><li>Практический продакшн-опыт работы с инструментами горизонтального масштабирования обработки, такими как Apache Spark (PySpark)</li><li>Проектирование моделей данных: проектирование схем, нормализация и развитие схемы без нарушения работы下游 потребителей</li><li>Уверенное знание SQL и основ реляционных баз данных</li><li>Развертывание и эксплуатация контейнеризированных приложений на Kubernetes, включая управление лимитами ресурсов и конфигурацией</li><li>Оркестрация рабочих процессов с помощью Airflow или другого DAG-планировщика, включая повторы, обратные заполнения (backfills) и зависимости</li><li>Стек наблюдаемости: Prometheus, Grafana и Alertmanager, применяемый к мониторингу здоровья конвейеров и свежести данных</li><li>Построение и управление поисковыми индексами, включая проектирование маппингов и переиндексацию</li><li>Интеграция с Fivetran или аналогичными управляемыми инструментами коннекторов для приема данных из сторонних источников</li><li>Blob или data lake хранилища как неизменяемое хранилище сырых данных, включая секционирование и правила жизненного цикла</li></ul><p><strong>Будет плюсом</strong></p><ul><li>Векторные индексы и хранилища эмбеддингов, особенно pgvector, для семантического поиска по документам</li><li>Опыт в домене eDiscovery, включая понимание того, как рабочие процессы юридического ревью формируют требования к приему данных</li><li>Инструменты обработки документов и извлечения текста в больших объемах, такие как Nuix или Aspose</li><li>Relativity, включая его модель данных, форматы импорта и экспорта, и API</li><li>Цепочка хранения (Chain-of-custody)</li></ul><p><strong>Ваши обязанности</strong></p><ul><li>Проектирование и создание конвейеров приема и ETL, которые остаются надежными при росте объемов данных и количества источников</li><li>Развитие канонической модели данных: проектирование схем, нормализация и сопоставление «грязных» исходных систем с общей внутренней моделью — включая поля и объекты, которые не сопоставляются чисто</li><li>Обеспечение аудируемости сопоставления, чтобы всегда можно было проследить, как исходная запись стала канонической</li><li>Реализация инкрементального приема, который поглощает изменения вышестоящих схем без полной повторной обработки</li><li>Построение и поддержка поисковых индексов, от которых зависит глобальный поиск платформы — проектирование маппингов, стратегия переиндексации</li><li>Превращение конвейера, управляемого разработчиками, в самообслуживаемую, планируемую и контролируемую систему с надлежащими оповещениями о состоянии конвейеров и свежести данных</li><li>Работа с контентно-адресуемым хранилищем и дедупликацией принимаемого контента на основе хэшей</li></ul><p><b>Что мы предоставляем нашим сотрудникам</b></p><ul><li>18 рабочих дней оплачиваемого отпуска</li><li>10 рабочих дней больничного в год (5 дней оплачиваются в размере 100% и 5 дней в размере 75% вашей средней месячной зарплаты)</li><li>Гибкий график работы</li><li>Дополнительные выходные дни по особым случаям, выходные в национальные праздники</li><li>Конкурентоспособная и достойная зарплата, основанная на оценке эффективности / оценке знаний</li><li>Возможность делиться и получать знания на регулярных технических лекциях</li><li>Дружелюбная и профессиональная команда</li><li>Инновационные проекты с передовыми технологиями</li><li>Удаленная работа</li><li>Бухгалтерское обслуживание</li></ul> <div> <a href="https://jobs.dou.ua/companies/binariks/vacancies/369836/#reply-btn-id">Откликнуться на вакансию</a> </div>
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Ещё в Binariks
4 активные вакансии в компании
AI/ML инженер (Document Intelligence)
Компания Binariks ищет AI/ML инженера для разработки системы автоматической обработки документов в страховой сфере. Вы будете проектировать контракты данных, интегрировать OCR и LLM-сервисы, строить классификацию и извлечение полей с доказательствами. Требуется 3+ года опыта в продакшн AI/ML, знание LLM и OCR, а также английский на уровне Upper-Intermediate или выше.
Старший Platform / Infrastructure инженер
Инфраструктурный инженер уровня Senior для развёртывания Kubernetes-платформы в Китае. Нужен глубокий опыт с Kubernetes, Terraform, GitOps и облачными managed-сервисами. Предстоит решать задачи зеркалирования реестров, DNS, сертификатов и обеспечения резидентности данных в условиях китайских облаков.
BI/Big Data архитектор решений
Ищем опытного BI/Big Data архитектора для работы с клиентами: от предпродаж до внедрения. Требуется 5+ лет опыта в data engineering, BI и архитектуре данных, знание Snowflake, Redshift, BigQuery, Databricks, ETL/ELT, SQL, Python или Scala, BI-инструментов (Power BI, Tableau, Looker, Qlik) и облачных платформ (AWS, GCP, Azure). Предлагаем удаленную работу и полную занятость.
Похожие вакансии
6 вакансийСтарший Data Engineer
~2 641 000 – 3 664 122 ₸ оценка
Ищем старшего Data Engineer с опытом 6+ лет для работы над объединением платформы данных в компании, создающей SaaS-решения для брокеров и торговых фирм. Нужно проектировать и поддерживать пайплайны на PySpark, SQL и Databricks, внедрять CDC, работать с Medallion Architecture и Terraform. Предлагают удалённую работу, медстраховку, 25 дней отпуска и оплату обучения.
Инженер данных (Data Engineer)
Ищем опытного инженера данных для разработки платформы патентной аналитики. Нужно строить пайплайны для больших объёмов данных, использовать Lakehouse-архитектуру и инструменты вроде Spark, Databricks и Kafka. Требуется 4+ года опыта, знание Python и SQL, а также английский на уровне Upper-Intermediate. Компания предлагает гибкий график, оплачиваемый отпуск и образовательный бюджет.
Старший инженер данных (Kafka, Flink, AWS)
Ищем старшего инженера данных для разработки облачной платформы обработки телеметрии. Нужен опыт с Kafka, Flink, Java, Python, SQL, а также с AWS и Kubernetes. Предлагают удаленную работу, обучение и страховку.
Senior AI Engineer
~2 641 000 – 3 664 122 ₸ оценка
Вакансия для специалиста по AI, который будет проектировать и внедрять решения на основе больших языковых моделей и генеративного ИИ. Требуется опыт работы с LLM и генеративным ИИ, а также умение работать в команде. Предлагается удаленная работа, преимущественно во Франции.
MLOps инженер
~2 641 000 – 3 664 122 ₸ оценка
Ищем MLOps инженера для работы над AI-решениями в крупной американской компании. Вы будете проектировать и внедрять MLOps-архитектуру для моделей компьютерного зрения, автоматизировать пайплайны обучения и развертывания, работать с Python, PyTorch/TensorFlow, Docker, Kubernetes и GCP. Предлагают удаленную работу, конкурентную зарплату и хороший соцпакет.
Старший Data Engineer
~2 641 000 – 3 664 122 ₸ оценка
Ищем старшего инженера данных для создания автоматизированной платформы отчетности и аналитики для платежной компании. Нужно проектировать и строить ELT-пайплайны, интегрируя данные из платежных процессоров, CRM и ERP в облачное хранилище (Snowflake), автоматизировать финансовую отчетность и строить модели данных. Требуется 5+ лет опыта, экспертный SQL, опыт с dbt и оркестраторами. Предлагается полностью удаленная работа, гибкий график и стабильный доход.