Инженер GPU и ML инфраструктуры
Инженер по GPU и ML инфраструктуре в стартап, разрабатывающий модель для мониторинга состояния GPU. Вы будете отвечать за генерацию данных: перенос тестовых процедур на новое оборудование, автоматизацию развертывания, обеспечение качества телеметрии и создание бенчмарк-нагрузок, включая LLM-инференс и обучение. Требуется опыт работы с GPU, Linux и сбором телеметрии. Предлагается удаленная работа и полная занятость.
Зарплата не указана — оценили по рынку
На основе 132 похожих вакансий за 90 дней.
Что предстоит делать
<h3>Обзор роли</h3><p>Svitla Systems Inc. ищет <strong>инженера по GPU и ML-инфраструктуре</strong> на полную занятость (40 часов в неделю) в Украине. Наш клиент — технологический стартап, разрабатывающий фундаментальную модель, основанную на физике, для мониторинга и прогнозирования состояния GPU и вычислительных систем. Технология использует мультисенсорную телеметрию, физические стресс-сигналы, оценки деградации полупроводников и динамические математические признаки для оценки состояния оборудования с течением времени.</p><p>Команда проводит контролируемые эксперименты на GPU-системах, выполняя стандартизированные бенчмарки и стресс-нагрузки, одновременно собирая детальную аппаратную телеметрию (температура, мощность, тактовые частоты, счетчики ошибок и т.д.) из NVML, DCGM, BMC, Redfish и лабораторного оборудования. Методика тестирования валидирована на нескольких GPU-платформах. Мы расширяем её на более широкий парк оборудования: несколько поколений датацентровых NVIDIA GPU и встраиваемые/периферийные платформы, с добавлением новых целей со временем. Вы будете владеть стороной генерации данных от начала до конца: перенос методик тестирования на новые типы <em>узлов</em>, автоматизация развертывания, обеспечение качества и согласованности телеметрии на каждой цели и размещение документированных наборов данных в хранилище. Вы будете владеть рабочими нагрузками. Набор включает LLM-инференс и обучающие нагрузки (модели семейства Llama нескольких размеров, квантованные и полной точности), с расширением до более крупных моделей по мере перехода на GPU с большим объемом памяти. Воспроизводимость критически важна: идентичная нагрузка при каждом запуске, чтобы вариативность исходила от оборудования, а не от рабочей нагрузки. Вы строите систему, которая надежно производит данные, от которых зависит команда моделирования.</p><h3>Требования</h3><ul><li>Опыт развертывания LLM-инференса и обучающих нагрузок на GPU, включая квантованные модели.</li><li>Подтвержденная способность самостоятельно диагностировать проблемы с датчиками и выборкой в аппаратных временных рядах.</li><li>Понимание того, как сделать GPU-нагрузку воспроизводимой от запуска к запуску: контроль источников недетерминизма.</li><li>Глубокое понимание Linux-систем, стеков драйверов GPU, оркестрации процессов, планирования и поведения по таймингам.</li><li>Опыт программного сбора аппаратной телеметрии, внутриполосно (NVML, DCGM) и внеполосно (BMC / IPMI / Redfish).</li></ul><h3>Желательно</h3><ul><li>Опыт создания конвейеров сбора данных для тестирования оборудования, квалификации или системных исследований.</li><li>Знакомство с инструментами GPU-бенчмарков и стресс-тестирования (вычисления, пропускная способность памяти, многопроцессорная связь) и методологией бенчмарков (прогрев, установившееся состояние, вариативность от запуска к запуску).</li><li>Хорошее понимание семантики управления питанием и температурой GPU, например, причин троттлинга тактовой частоты.</li><li>Понимание многопроцессорного масштабирования для более крупных моделей (тензорный/конвейерный параллелизм, NCCL).</li><li>Опыт создания автоматизированной валидации качества данных для временных рядов или данных с датчиков.</li></ul><h3>Обязанности</h3><ul><li>Перенос методики тестирования на новое оборудование. Датацентровые GPU и периферийные устройства различаются стеками драйверов, мощностью, тепловыми режимами и доступными датчиками. Адаптируйте методику, документируйте, что изменилось и почему.</li><li>Создание и поддержка набора бенчмарк-нагрузок: синтетические ядра (GEMM, свертки), LLM-инференс и обучение, а также новые классы по мере расширения целевых классов, включая модели компьютерного зрения для периферийных устройств. Это контролируемые генераторы нагрузки для характеризации оборудования.</li><li>Владение корректностью и согласованностью логирования. Сделайте сбор предсказуемым на всех платформах и источниках: поддерживайте заданные частоты выборки, обеспечивайте надежные временные метки, используйте согласованные имена полей и выравнивайте часы между внутриполосными и внеполосными источниками. Диагностируйте аномалии выборки до первопричины.</li><li>Автоматизация развертывания. Воспроизводимый процесс без участия человека: развертывание нагрузок и логгеров на новом <em>узле</em>, выполнение расписания запусков, сбор и чистое завершение. Запуски воспроизводимы из конфигурации.</li><li>Создание автоматизированных проверок качества данных. Выявление пропущенных или нерегулярных выборок, рассинхронизации часов между логгерами, телеметрии, не соответствующей нагрузке, и датчиков, молча возвращающих пустые данные на новом оборудовании.</li><li>Владение передачей данных в хранилище. Размещение данных в согласованном, документированном формате с полными метаданными запуска (целевое оборудование, версии драйверов и прошивок, версия методики, расписание).</li><li>Документирование каждой целевой аппаратной платформы.</li></ul><h3>Почему стоит присоединиться к Svitla</h3><p>Svitla Systems — глобальная компания цифровых решений со штаб-квартирой в США и операциями в Америке, Европе, Азии и Азиатско-Тихоокеанском регионе. С 2003 года мы обслуживаем широкий круг клиентов — от инновационных стартапов до компаний из списка Fortune 500. Наш успех строится на партнерстве. Интегрируясь в команды клиентов, мы создаем долгосрочные коллаборации, которые приносят реальные результаты. Мы активно поддерживаем гибкость рабочего места, удаленную культуру и индивидуальный подход к профессиональному и личностному росту.</p><p>Наша глобальная миссия — построить бизнес, который способствует благополучию наших партнеров, сотрудников и их семей, улучшает наши сообщества и вносит долгосрочный вклад в мир. Вместе мы пишем код более светлого будущего — и живем им.</p><p><b>Присоединяйтесь к нам!</b></p> <div> <a href="https://jobs.dou.ua/companies/svitla-systems-inc/vacancies/369472/#reply-btn-id">Відгукнутись на вакансію</a> </div>
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Ещё в Svitla Systems
3 активные вакансии в компании
Инженер машинного обучения с физическим моделированием
~2 618 070 – 3 615 430 ₸ оценка
Ищут инженера машинного обучения для стартапа, который строит модель для оценки состояния GPU и вычислительной техники на основе физических сигналов. Вы будете проектировать и обучать модель с физически-информированной функцией потерь, работать с временными рядами и телеметрией, а также улучшать пайплайн обработки данных. Требуется опыт с PINN или подобными подходами, сильный Python и понимание физики деградации. Предлагают удаленную работу, конкурентную оплату и хороший соцпакет.
Старший MLOps инженер
~2 618 070 – 3 615 430 ₸ оценка
Ищем Senior MLOps Engineer для работы с AI/ML на Azure в глобальной SaaS-среде. Требуется опыт проектирования инфраструктуры для ML-нагрузок, CI/CD и DevOps-инструментов. Предлагают удаленную работу, конкурентную зарплату и гибкий график.
Похожие вакансии
6 вакансий
Разработчик источников данных (SQL)
~2 419 845 ₸ оценка
Компания ПИК Digital ищет разработчика источников данных для BI-отчетности. Нужно будет создавать витрины данных, оптимизировать SQL-запросы и сопровождать аналитические решения. Требуется уверенный SQL и опыт с MS SQL Server/PostgreSQL. Предлагают удаленную работу и обучение.
AI-инженер (RAG, LLM)
~2 419 845 ₸ оценка
Ищем AI-инженера для разработки AI-агентов и RAG-систем в HRTech. Нужен опыт с LangChain, RAG, Fine-tuning и Docker. Предлагают работу в бигтех-компании с профессиональным развитием и участием в конференциях.
Аналитик баз данных
~2 419 845 ₸ оценка
Аналитик баз данных в IT-компании DSSL: заниматься количественным анализом данных, писать SQL-запросы и аналитические отчеты. Требуется опыт от 1 года, уверенный Excel и знание SQL. Будет плюсом Python и SPSS.
Python-разработчик (Data Engineering)
~2 419 845 ₸ оценка
Ищем Python-разработчика с уклоном в Data Engineering: писать код на Python/SQL, работать с Airflow, собирать и проверять данные для бизнеса и ML-моделей. Нужен уверенный SQL, опыт с Pandas/Polars и PostgreSQL. Компания предлагает стабильную работу, ДМС, обучение и корпоративные бонусы.
Data & BI Product Builder (Databricks)
~2 419 845 ₸ оценка
Danone ищет Data & BI специалиста для работы с Databricks: разработка ETL/ELT-процессов, миграция данных и подготовка отчетности для Power BI. Нужны опыт с Databricks, уверенные SQL и Python, английский Intermediate+. Предлагают удаленную работу, официальное оформление и обучение.
Аналитик данных / Аналитик по моделированию данных
Вакансия аналитика данных с фокусом на моделирование данных и архитектуру. Нужно анализировать данные, строить отчеты и дашборды в Power BI, проектировать модели данных (Kimball, Medallion Architecture) и работать с командами. Требуется опыт в аналитике, продвинутый SQL и знание Power BI. Контракт на 3 месяца.