Перейти к содержимому
Deep Knowledge Group
D
Deep Knowledge Group

Инженер по сбору данных (Data Engineer)

Инженер по данным для построения и поддержки пайплайнов сбора и очистки данных из публичных источников. Нужны сильный Python, опыт скрапинга, SQL, работа с LLM. Предлагают удаленную работу, оплачиваемое тестовое задание и сотрудничество с командой AI и data-инженеров.

middle удалённо ~1 063 313 – ~1 849 240 ₸ (2 300 – 4 000 USD)
Языки: English · Intermediate
salary intelligence

Зарплата ниже рынка

На 66% ниже медианы Data/ML по 96 вакансиям за 90 дней.

эта
1 456 277 ₸
медиана
4 237 533 ₸
p25–p75
1 456 277 – 6 356 763 ₸
Хотите увидеть распределение по грейдам и городам? Зарплаты Data/ML Калькулятор зарплат
Вакансии в Telegram-канале
Свежие вакансии Каждый день
Подписаться
??%
Match Score
Войдите и создайте резюме
Войти
описание

Что предстоит делать

##### О работе Мы создаем и поддерживаем базы данных отраслевой аналитики — организации, люди, продукты и их взаимосвязи в таких секторах, как HealthTech, QuantumTech, LegalTech и велнес, охватывая несколько регионов. Каждая из них начинается с «сырых» публичных данных и должна превратиться в чистый, дедуплицированный, проверяемый набор данных, на который могут полагаться аналитики и downstream-продукты. Это означает, что сложные задачи здесь — не «написать скрапер». Они в другом: как понять, что две записи — это одна и та же организация? Как доказать, откуда взялось поле шесть месяцев спустя? Как перезапустить сбор данных с источника, который изменил свою разметку, не повредив то, что уже есть? Вы будете работать напрямую с руководителем направления Data Science и командой инженеров по AI и данным. Что вы будете делать Создавать и сопровождать пайплайны сбора данных из публичных веб-источников — структурированных, полуструктурированных и «неудобных» Проектировать слой обогащения: нормализация, дедупликация, разрешение сущностей, оценка уверенности Вести происхождение (provenance) каждого поля, чтобы любое значение можно было проследить до источника и даты Использовать LLM там, где они действительно полезны — извлечение из неструктурированного текста, классификация, назначение таксономий — и понимать, где они не работают Переводить наборы данных от разового сбора к регулярным, отслеживаемым, перезапускаемым пайплайнам Определять и обеспечивать проверки качества: покрытие, актуальность, доля дубликатов, полнота полей Что мы ищем Оба уровня Сильный Python — вы пишете сервисы и пайплайны, а не ноутбуки Реальный продакшн-опыт в скрапинге: сессии, лимиты запросов, ретраи, блокировки, антибот-защита, JS-рендеринг страниц, недокументированные API SQL и PostgreSQL за пределами CRUD — индексы, планы запросов, проектирование схем Практический опыт работы с LLM API для извлечения и классификации, включая валидацию их результатов Чутье на качество данных: вы проверяете собранное, прежде чем передавать дальше Дополнительно для позиции Senior Вы владели платформой данных целиком, а не отдельными задачами на ней — оркестрация, планирование, мониторинг, бэкфиллы Опыт в разрешении сущностей или связывании записей из источников, которые противоречат друг другу Airflow, Dagster или Prefect в продакшене Вы задавали стандарты, по которым работали другие: схемы, конвенции, ревью Будет плюсом Docker и CI/CD Графы знаний, онтологии или проектирование таксономий Векторный поиск и RAG-пайплайны Методология OSINT и проверка источников Опыт работы с лицензированием данных или ограничениями комплаенса при сборе из публичного веба Как мы нанимаем Вводный звонок — 30 минут, взаимное соответствие и то, что вы реально создавали Оплачиваемое тестовое задание — реальная, ограниченная по объему часть нашей работы. Оплачивается по рыночной ставке, примерно 4 часа. Мы не просим никого работать бесплатно Техническое ревью — мы вместе разбираем ваше решение: ваши компромиссы, что бы вы сделали при наличии большего времени, что бы сделали иначе при десятикратном объеме данных Оффер — вилка зарплаты определяется уровнем, на который вы выходите, а не должностью, на которую вы подавались Мы оцениваем тестовое задание по качеству суждений, а не по «полировке». Воспроизводимость, честная работа с краевыми случаями и ясные рассуждения о том, что вы решили не делать, ценятся выше, чем остроумная однострочная находка. Что для нас важно Две вещи, в основном. Вы подвергаете сомнению собственные данные. Инженеры, которые хорошо работают у нас, — это те, кто замечает, что источник молча изменил свою схему, что «97% совпадений» скрывает систематическое смещение, что поле заполнено, но неверно. Объем без проверки для нас ничего не стоит. Вы объясняете свои рассуждения. Значительная часть этой работы — это оценочные суждения, которые никто не может быстро проверить: какая запись побеждает при слиянии, какой порог уверенности использовать, когда прекратить обогащение. Нам нужно, чтобы эти решения были задокументированы и защитимы, а не спрятаны в скрипте. Чтобы подать заявку: отправьте резюме плюс один короткий абзац о самой сложной задаче по сбору данных или дедупликации, которую вы решили, и о том, что вы сделали неправильно на этом пути.

навыки

Стек и инструменты

Поделиться

Подходит ли вам эта вакансия?

Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть

Создать аккаунт PDF-парсинг резюме за 2 минуты

Похожие вакансии

6 вакансий
P
PwC
13 ч. назад

Младший AI инженер

~1 976 965 ₸ оценка по стеку

PwC ищет Junior AI Engineer для разработки AI-решений на Python, интеграции с LLM и автоматизации процессов. Требуется 1-3 года опыта в разработке, знание Python, SQL и интерес к AI. Предлагают удаленную работу или офис во Львове, обучение и карьерный рост.

Python Generative AI LLM +4
middle удал. dou
A
Artellence
1 д. назад

Machine Learning Engineer

~1 976 965 ₸ оценка по стеку

Компанія Artellence, що займається OSINT та AI-технологіями, шукає Machine Learning Engineer з досвідом від 2 років. Потрібні глибокі знання машинного навчання, Python, NLP та робота з даними. Пропонується віддалена робота, гнучкий графік та участь у значущих проєктах для безпеки України.

AI OSINT NLP +9
middle удал. dou
S
Soul Defence
1 д. назад

Applied AI Engineer

~1 976 965 ₸ оценка

Шукаємо Applied AI Engineer для розробки алгоритмів виявлення, класифікації та трекінгу об'єктів на основі ML та обробки сигналів. Потрібен досвід з Python та ML-системами, сильна математична база. Пропонують повну зайнятість, віддалену роботу та 24 дні відпустки.

Machine Learning Python Computer Vision +3
middle удал. dou
AgileEngine
A
AgileEngine
1 д. назад

Middle Data Engineer

~1 976 965 ₸ оценка

Ищем Middle Data Engineer для модернизации хранилища данных в Databricks Lakehouse. Нужно строить пайплайны на PySpark и Delta Lake, работать с потоковыми данными и мигрировать легаси-ETL. Требуется 3+ года опыта, знание Spark, SQL, Python, Databricks. Предлагают удаленную работу, гибкий график и конкурентную зарплату в USD.

Databricks PySpark Delta Lake +9
middle удал. dou
M
MODUS X
2 д. назад

Data Engineer (Microsoft Fabric)

~1 976 965 ₸ оценка

Компанія MODUS X шукає Data Engineer для роботи з Microsoft Fabric та Azure. Потрібен досвід побудови дата-архітектури, ETL/ELT-процесів, знання T-SQL, DAX, Python. Пропонують віддалену роботу за контрактом.

Microsoft Fabric Azure Synapse Data Factory +19
middle удал. dou
R
Recordly
1 д. назад

Инженер по ИИ и машинному обучению

~2 412 405 – ~2 948 495 ₸ (4 500 – 5 500 EUR)

Ищем инженера для разработки и внедрения AI/ML-решений в продакшн, с фокусом на агентные системы и генеративный ИИ. Нужен опыт работы с Python и облачными платформами, а также свободный финский язык. Предлагается удаленная работа из Финляндии.

AI ML агентные системы +3
middle удал. cr