Перейти к содержимому
X
Xenoss

Старший Data Scientist (AdTech, programmatic supply)

Ищем старшего data scientist'а с бэкграундом в programmatic AdTech (supply side), который не только строит модели, но и доводит их до продакшена на живом трафике: curation-модель скорит bid requests в реальном времени с бюджетом менее 5 мс, а look-alike и контекстные модели работают в батче. Нужен продакшен-Python, gradient-boosted trees, работа с задержанными лейблами и неполными данными, MLOps со shadow/canary-выкатками и строгая изоляция данных рекламодателей — плюс 6+ лет опыта и уверенный английский C1+. Проект в Google Cloud с передачей моделей и ранбуков инженерной команде клиента; предлагают роль в сильной delivery-команде и работу над outcome-driven кампаниями для финансового сектора.

senior удалённо ~2 464 956 ₸

Отклик отправляется на сайте источника. Регистрация в Taylor для перехода не нужна.

Языки: English · Advanced
salary intelligence

Зарплата не указана — оценили по рынку

На основе 91 похожих вакансий за 90 дней.

оценка p25–p75
1 375 400 – 3 594 364 ₸
медиана: 2 464 956 ₸
Хотите увидеть распределение по грейдам и городам? Зарплаты Data/ML Калькулятор зарплат
Вакансии в Telegram-канале
Свежие вакансии Каждый день
Подписаться
??%
Match Score
Войдите и создайте резюме
Войти
описание

Что предстоит делать

<h3>Описание роли</h3><p>Senior data scientist, который также занимается инженерией в составе delivery-команды, создающей платформу оптимизации по результатам (outcome-optimisation) и скоринга для независимого SSP. Роль предполагает создание, оценку и эксплуатацию моделей трёх семейств: модели курирования (curation) в реальном времени, look-alike моделирования с дополнением сегментов (segment augmentation) и контекстной сегментации. Язык разработки — Python.</p><p>Два data scientist’а в команде — равноправные участники. Ответственность за три семейства моделей распределяется между ними на старте проекта, поэтому в этой роли нужно быть убедительным по всем трём, включая то, которое ограничено задержкой (latency-bound). Выбор модели — не самая сложная часть работы. Метки конверсий приходят через часы или недели после показа, данные рекламодателей можно объединять лишь в тех пределах, которые допускает каждый рекламодатель, а готовая система передаётся команде клиента, в которой нет data scientist’ов.</p><p><strong>Требуется опыт в AdTech на стороне programmatic supply.</strong> Глубокая экспертиза в CTV, audio или social — это преимущество, а не обязательное условие.</p><h3>О проекте</h3><p>Клиент: независимая supply-side платформа с продуктами для курирования, идентификации и managed-сервисов; работа ведётся напрямую. Первый сценарий использования — кампании, ориентированные на результат (outcome-driven), для рекламодателей из сферы финансовых услуг, которые платят за реальные результаты — открытие счетов и депозиты, — а не за CPM или CTR.</p><p>Продукт: платформа скоринга и оптимизации, работающая на инфраструктуре клиента в двух плоскостях. Центральная плоскость в Google Cloud содержит данные и фундамент признаков, обучение моделей, MLOps и эксперименты, а также управление и отчётность. Периферийная (edge) плоскость — это портируемый контейнер скоринга, разворачиваемый внутри сред исполнения сторонних SSP.</p><p>Каналы в рамках проекта: первоначальный production-релиз охватывает один согласованный набор каналов. Развёртывание идёт в порядке приоритета клиента: сначала CTV, затем web и app video, display, audio, native и DOOH. Social — приоритет для создания и оптимизации сегментов, а не для оптимизации кампаний.</p><p>Моделирование: три семейства моделей, определённые клиентом. Модель курирования использует gradient-boosted trees на табличных признаках и оценивает bid requests в реальном времени. Look-alike и контекстная модели работают в batch-режиме. Gradient-boosted trees — базовая линия и для остальных, но не жёсткое ограничение. Подход для batch-семейств выбирается на основе данных в Фазе 1 и утверждается вместе с архитектурой в Фазе 2.<br><br></p><h3>Факторы, определяющие роль</h3><ul><li>Только модель курирования ограничена задержкой. Её бюджет — менее 5 мс на полный round trip при p99+, причём выполнение модели — лишь часть этого времени. Look-alike и контекстная модели не работают в реальном времени.</li><li>Одновременно работают два режима исполнения. Динамический режим выполняет скоринг внутри аукционов сторонних SSP. Статический режим — batch-режим с управлением человеком. Он формирует результаты не чаще одного раза в день, которые клиент активирует через свои инструменты курирования и работы с аудиториями.</li><li>Двое «часов» обратной связи. Данные bidstream возвращаются в течение двух-трёх часов и обеспечивают быструю адаптацию. Детерминированные конверсии возвращаются через часы или недели, а для одного отраслевого фида — до шести месяцев, и обеспечивают обучение, калибровку и оценку.</li><li>Данные рекламодателей не должны смешиваться между собой. Архитектура — общая базовая модель плюс изолированные клиентские инстансы, причём изоляция обеспечивается на уровне датасетов, пайплайнов, артефактов моделей и инстансов скоринга.</li><li>Права на данные — это конфигурация времени выполнения. Позиция каждого рекламодателя выясняется при онбординге, уже после запуска системы, поэтому новая политика не должна требовать переработки системы.</li><li>Объединённые исторические данные для обучения по всем рекламодателям в основном недоступны, поэтому cold start — это задача проектирования с первого дня.</li><li>Начальный объём — около 10 000 QPS на кампанию. Скоринг проходит весь подходящий трафик, но логирование сэмплируется в пределах того, что каждый SSP разрешает выносить из своей среды.</li><li>Клиент стандартизирует входные поля между SSP, поэтому модели видят единообразную схему запроса.</li><li>Все датасеты поставляются в Google Cloud примерно из дюжины источников. Определение схем, ключей соединения, исторического покрытия и задержки меток — это первая фаза работы.</li><li>У клиента нет собственных data scientist’ов. Модели, практики тюнинга и runbooks в конце передаются его инженерной команде.</li></ul><h3>Ключевые обязанности</h3><p><strong>Разработка моделей (основная задача)</strong></p><ul><li>Создавать и отвечать за модели в закреплённых на старте семействах и быть способным перенять любое из трёх.</li><li>Разрабатывать модель курирования: gradient-boosted trees на признаках, доступных в момент запроса, с размером и экспортом, позволяющими уложиться в бюджет 5 мс вместе с поиском признаков, маршрутизацией и проверкой политик.</li><li>Разрабатывать look-alike моделирование и дополнение сегментов в рамках согласованного объёма первого релиза: аудитории, создаваемые на основе подтверждённых конвертеров, добавление, удаление и объединение сегментов, а также поддержка как существующей логики performance look-alike, так и новой поведенческой логики.</li><li>Разрабатывать контекстную сегментацию: сегменты по паблишеру, домену, плейсменту, формату и географии, которые показывают повышенный индекс (over-index) относительно целевого результата.</li><li>Реализовывать многокритериальные решения с ограничениями, где веса настраиваются оператором, а жёсткие ограничения хранятся отдельно от предсказаний.</li></ul><p><strong>Отложенные метки и изоляция данных</strong></p><ul><li>Проектировать целевую функцию с двумя «часами»: прокси-таргеты из сигналов bidstream для быстрой адаптации, калибруемые по детерминированным результатам по мере их поступления.</li><li>Решать проблемы cold start и разреженных данных там, где объединённое обучение не разрешено.</li><li>Моделировать сезонность в пределах дня, недели и квартала и отслеживать concept drift.</li><li>Обучать общую базовую модель и изолированные клиентские инстансы с помощью пайплайнов, которые считывают политику прав на данные каждого рекламодателя во время выполнения.</li><li>Автоматизировать решение о переводе кампании с общей базовой модели на её клиентскую модель.</li></ul><p><strong>MLOps и оценка</strong></p><ul><li>Создавать воспроизводимые пайплайны обучения и оценки с версионированием моделей и признаков, реестром и статусами согласования.</li><li>Продвигать модели через офлайн-валидацию, shadow, canary и champion/challenger с откатом к предыдущему champion.</li><li>Измерять прирост результата относительно контрольных групп, используя существующую у клиента возможность разделения трафика.</li><li>Подготовить Alpha: модель, оценённую на отложенном историческом окне, рядом с собственной базовой линией оператора по согласованному KPI, а также вклад в бенчмарк реализуемости по задержке для пути скоринга.</li><li>Определять триггеры переобучения, а также мониторинг drift и guardrail-метрик совместно с DevOps / Infrastructure Engineer.</li></ul><p><strong>Взаимодействие и передача</strong></p><ul><li>Работать с data-инженерами над пайплайнами признаков, корректностью на момент времени (point-in-time correctness) и предотвращением утечек данных.</li><li>Представлять решения по моделированию на этапных гейтах руководству клиента по продукту и инженерии.</li><li>Писать код и документацию, которые инженеры клиента смогут поддерживать. AI-инструменты используются под контролем человека, и за каждое изменение отвечает конкретный инженер. [XENOSS DATA POINT: AI-usage policy]</li><li>Подготовить передачу моделей и тюнинга команде, которая будет эксплуатировать модели без data scientist’ов.</li><li>Своевременно сообщать о пробелах в данных, проблемах с метками и рисках зависимостей Solution Architect / Tech Lead.</li></ul><h3>Обязательные квалификации</h3><p><strong>Опыт</strong></p><ul><li>6+ лет создания machine-learning моделей, дошедших до production, — от проектирования признаков до деплоя и мониторинга.</li><li>Минимум одна модель, задеплоенная в пути real-time bidding — на стороне DSP или SSP — с измеряемым бюджетом задержки.</li><li>Оценка моделей относительно контрольной группы, holdout, A/B или champion/challenger и представление прироста нетехнической аудитории.</li><li>Опыт работы по проекту с фиксированными сроками и этапными гейтами с внешним клиентом.</li><li>Английский: уверенный письменный и устный, фактически C1+. В этой роли придётся выступать перед техническим руководством клиента.</li></ul><p><strong>Технические компетенции</strong></p><ul><li>Python — production-код, который упакован, протестирован и поддаётся ревью, а не только ноутбуки.</li><li>Gradient-boosted trees — XGBoost, LightGBM или CatBoost на табличных данных, включая калибровку и баланс между глубиной и количеством деревьев и задержкой инференса.</li><li>Обучение на неполных метках — positive-unlabelled learning, моделирование задержки конверсий и прокси-целевые функции.</li><li>Методы сегментации — embeddings, similarity search, кластеризация и анализ over-indexing.</li><li>Эксперименты — дизайн holdout и статистическая мощность при низких конверсиях.</li><li>MLOps — реестр, версионирование, shadow- и canary-развёртывание, мониторинг drift и автоматическое переобучение.</li><li>SQL и облачные платформы данных — предпочтительно BigQuery и Google Cloud; AWS или Azure допустимы.</li></ul><p><strong>Знание предметной области — обязательно</strong></p><ul><li>Механика programmatic-аукционов — bid requests и responses, floors, deals, события win и impression, а также место решений supply-side в аукционе.</li><li>Измерение результатов — окна атрибуции, задержка конверсий, детерминированный и вероятностный матчинг и почему метрики аукциона — лишь прокси для результатов.</li><li>Основы идентификации — хешированный email, IP, cookies, UID2 и ограничения приватности на их объединение. Требуется понимание лежащей в основе логики. Собственные продукты и фиды данных клиента осваиваются по ходу работы.</li></ul><p><strong>Суждения &amp; soft skills</strong></p><ul><li>Называет технику конкретно. Говорит gradient-boosted trees или positive-unlabelled learning, а не обобщённое «AI».</li><li>Прямо говорит, что доказано, а что нет, в том числе перед клиентом.</li><li>Отстаивает свою позицию по моделированию перед технически сильными стейкхолдерами клиента и пересматривает её, когда ему доказывают, что он неправ.</li><li>Относится к правилам изоляции данных как к жёстким ограничениям, а не как к пожеланиям.</li><li>Создаёт решение для команды, которая унаследует работу, а не для того, кто её написал.</li></ul><p><strong>Не требуется</strong></p><ul><li>Исследования в области deep learning или новые архитектуры. На пути реального времени используются gradient-boosted trees, поскольку глубокие модели не укладываются в бюджет задержки.</li><li>Разработка LLM-приложений или агентов. Агентные интерфейсы вне рамок этого проекта.</li><li>Работа над дашбордами или фронтендом. Клиент сам строит отчётность на предоставляемых фидах.</li></ul><p><strong>Будет плюсом</strong></p><ul><li>Инференс модели за единицы миллисекунд в production при 100k+ QPS.</li><li>Оптимизация кампаний или аудиторий в CTV, audio или social.</li><li>Данные о результатах из сферы финансовых услуг или другой регулируемой вертикали.</li><li>Курирование на стороне supply или оптимизация на уровне deals.</li><li>Оптимизация с ограничениями или многокритериальная — скаляризованные целевые функции, компромиссы по Парето.</li><li>Передача моделей команде, в которой нет data scientist’ов.</li></ul><h3>Профиль идеального кандидата</h3><p>Senior data scientist из programmatic adtech, который доводит модели до продакшена, а не создаёт прототипы, — тот, чья работа принимала решения на живом трафике, а не только готовила аналитику о нём.</p><p>Он пишет production-код на Python и думает о модели вплоть до пути её обслуживания. Когда ему называют бюджет задержки, он сначала спрашивает, сколько стоит поиск признаков, а уже потом — о точности модели. Он столь же уверенно чувствует себя в batch-части, где вопрос в том, что должно содержать аудиторное или контекстное сегментирование, а не в том, как быстро его можно оценить.</p><p>Он внимательно рассуждает о метках. Отложенные конверсии, прокси-таргеты и положительные примеры без надёжных отрицательных — знакомые проблемы, а не сюрпризы, ведь каждое семейство моделей в этом проекте сталкивается как минимум с одной из них.</p><p>Он уважает границы данных. Изоляция рекламодателей — это ограничение дизайна, а не пункт комплаенса, и он закладывает её в пайплайны и артефакты моделей, а не полагается только на политику.</p><p>Он убедителен перед техническим клиентом. У руководства клиента есть собственный опыт в machine learning. Он объясняет выбор моделей точными терминами, говорит, что ещё не доказано, и документирует свою работу так, чтобы инженеры клиента могли её запускать после его ухода.</p><p><br><br></p> <div> <a href="https://jobs.dou.ua/companies/xenoss/vacancies/373495/#reply-btn-id">Откликнуться на вакансию</a> </div>

навыки

Стек и инструменты

Поделиться

Подходит ли вам эта вакансия?

Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть

Создать аккаунт PDF-парсинг резюме за 2 минуты

Ещё в Xenoss

5 активных вакансий в компании

1 нед. назад

Старший Cloud Operations инженер

~2 152 589 – 4 048 720 ₸ оценка по стеку

Компания Toshiba Global Commerce Solutions ищет старшего инженера для управления облачной инфраструктурой Azure и обеспечения работы SaaS-продуктов для автоматизации розничной торговли. Нужен опыт с Azure, Kubernetes (AKS), Docker, CI/CD и IaC, а также отличный английский. Предлагается работа в международной компании с крупными клиентами по всему миру.

Azure AKS Kubernetes +5
senior Краків dou
2 нед. назад

Инженер по сборке и инфраструктуре (C++/Go)

~2 152 589 – 4 048 720 ₸ оценка

Ищем опытного инженера по сборке и инфраструктуре для greenfield-проекта: создание CI/CD для кодовой базы на C++ и Go, настройка окружений до UAT и подготовка к передаче в дата-центры клиента. Требуется 5+ лет опыта, владение C++/Go, контейнеризацией, IaC и наблюдаемостью. Работа полный день, с высокой нагрузкой на старте.

C++ Go CI/CD +4
senior удал. dou
2 нед. назад

Go инженер (реконсиляция и расчёты)

~1 587 000 – 3 121 176 ₸ оценка

Ищем опытного Go-инженера для создания с нуля системы сверки и расчётов в рекламной платформе. Нужно будет строить конвейер обработки уведомлений от биржи, обеспечивать идемпотентность и обработку дубликатов, а также интегрироваться с аналитической инфраструктурой клиента. Требуется 5+ лет опыта с Go, понимание adtech-биллинга и умение работать с внешними источниками данных.

Go C++ adtech +5
senior удал. dou
2 нед. назад

C++ инженер (ad-serving bridge)

~1 775 223 ₸ оценка

Ищем опытного C++ инженера для разработки высоконагруженного рекламного моста между supply-side платформой и японской биржей программной линейной рекламы. Нужно 6+ лет продакшн C++, опыт работы с большими чужими кодовыми базами и знание adtech (OpenRTB, аукционы, рекламные паузы). Работа полная, проект greenfield, стек C++ и Go, развертывание в дата-центрах клиента.

C++ adtech ad serving +4
senior удал. dou

Похожие вакансии

6 вакансий
LITSLINK
L
LITSLINK
8 ч. назад

Архитектор LLM

~2 464 956 ₸ оценка

LITSLINK ищет архитектора LLM для построения production-системы анализа документов и извлечения структурированных данных: нужно спроектировать пайплайн от начала до конца и лично участвовать в реализации ключевых компонентов. Ждут опыт вывода 3+ LLM-систем в продакшен, глубокие знания NLP, RAG, гибридного поиска, эмбеддингов, реранкинга, дедупликации и оценки качества (Precision/Recall, golden sets, CI quality gates), сильный Python. Предлагают удалённую работу, первые 2+ месяца полная занятость с переходом на part-time, прямую коммуникацию с командой и клиентом и долгосрочное сотрудничество.

LLM RAG NLP +11
senior удал. dou
H
HOLYWATER TECH
10 ч. назад

AI Engineer

~2 464 956 ₸ оценка по стеку

HOLYWATER TECH шукає AI Engineer, який будуватиме агентські пайплайни для ШІ-генерації серіалів: від сценарію до генерації відео та монтажу без ручних етапів, з виводом прототипів у продакшн. Основний стек — TypeScript, Nest.js, Next.js, PostgreSQL, Redis, Docker, плюс досвід з Agentic AI (multi-agent, tool calling, MCP, RAG) та генеративним відео (FFmpeg, video APIs). Потрібно 3-4+ роки досвіду в розробці; працювати можна віддалено, з офісу в Києві чи Львові або за кордоном, з навчанням, страховкою та 20 днями відпустки.

AI Engineer Agentic AI multi-agent workflows +20
senior удал. dou
S
Stape
12 ч. назад

Инженер данных (Data Engineer)

~2 464 956 ₸ оценка

Stape — глобальная продуктовая IT-компания, лидер рынка server-side tracking с нагрузкой 5+ млрд запросов в день, ищет опытного Data Engineer в команду аналитики. Нужно проектировать и строить дата-платформу: batch- и streaming-пайплайны, ETL/ELT, интеграции с CRM, модели данных для аналитики; стек — SQL, Python, GCP (BigQuery, Pub/Sub, Dataflow), Airflow, dbt/Dataform, требуется 4+ года опыта и английский Upper-Intermediate. Предлагают полную удалёнку с гибким графиком, бюджет на обучение и здоровье, 30 дней PTO и работу над высоконагруженным продуктом международного уровня.

Data Engineering SQL Python +12
senior удал. dou
S
Symphony Solutions
12 ч. назад

Инженер голосовых AI-систем (Realtime AI, консультант)

~2 464 956 ₸ оценка

Нужен опытный инженер по голосовым AI-системам, который проведёт аудит работающего realtime-моста Twilio ↔ AI: медиапотоки, контракты с платформой в AWS, обработка вызовов, сессионная логика LLM, алертинг и готовность к продакшену. Ключевые требования — уверенный TypeScript/JavaScript, практика с AWS, Docker, LLM-сессиями в режиме реального времени (WebSockets, gRPC, WebRTC) и инструментами распознавания/синтеза речи. Формат — частичная занятость: отчёт с находками и роадмап, а затем консультационная поддержка внедрения.

AI LLM Voice AI +22
senior удал. dou
G
Grid Dynamics
13 ч. назад

Старший Data Engineer (GCP)

~2 464 956 ₸ оценка по стеку

Grid Dynamics ищет старшего Data Engineer с опытом GCP для разработки и поддержки ELT-пайплайнов и миграции данных на Amperity. Нужны сильные Python, SQL, опыт с Google Cloud, Airflow/Kubeflow, Docker и Kubernetes. Предстоит работать над моделью рекомендаций для крупнейшей сети универмагов США в команде из 15 инженеров.

Python SQL GCP +11
senior удал. dou
Z
Zfort
15 ч. назад

Старший AI инженер (NLP/ML, LLM)

~2 464 956 ₸ оценка по стеку

Нужен старший AI-инженер для продукта ProVision: будет строить ML- и NLP-модели, внедрять LLM в продакшн (RAG, fine-tuning, оценка и мониторинг) и оптимизировать их inference в AWS. Ждут 5+ лет опыта, уверенный Python, PyTorch или TensorFlow, опыт с data pipelines и понимание распределённых систем. Предлагают гибкий график, обучение и сертификации, курсы английского и корпоративные бенефиты.

AI ML NLP +27
senior удал. dou