Инженер AI-платформы (LLM/ML-инфраструктура)
Ищем опытного инженера для развития внутренней AI-платформы на GPU-инфраструктуре: запуск и оптимизация open-weight LLM, проектирование LLM-роутера, разработка агентов и MCP-серверов. Требуется сильная инженерная база, опыт с LLM/ML-инфраструктурой и распределёнными системами, знание Python будет плюсом. Предлагают удалённую работу по московскому времени, обучение, ДМС и другие льготы.
Зарплата не указана — оценили по рынку
На основе 216 похожих вакансий за 90 дней.
Что предстоит делать
Мы развиваем внутреннюю корпоративную платформу для запуска open-weight LLM и агентных решений на собственной GPU-инфраструктуре. Ищем опытного инженера, готового работать на стыке эксплуатации LLM, распределённых систем, платформенной архитектуры и быстро развивающихся агентных технологий. Мы не ожидаем, что один человек будет одинаково глубоко разбираться во всех перечисленных областях. Важно иметь сильную экспертизу как минимум в двух-трёх направлениях и быть готовым погружаться в смежные задачи.
- Следить за развитием open-weight LLM, систем инференса, coding agents и AI-инфраструктуры; находить перспективные технологии и оценивать их готовность к внедрению.
- Тестировать и сравнивать модели на GPU-серверах по качеству, скорости, задержкам, пропускной способности, нагрузке, потреблению памяти, сложности эксплуатации и стоимости инференса.
- Переводить успешные прототипы в надёжные промышленные решения, повышать производительность, отказоустойчивость и наблюдаемость платформы.
- Проектировать внутреннюю AI-платформу: LLM-роутер, механизмы маршрутизации, балансировки и управления нагрузкой, приоритизации, квотирования, кэширования, выбора моделей и graceful degradation.
- Разрабатывать агентов, MCP-серверы, скиллы, интеграции с агентными фреймворками, системы оценки качества и другие платформенные компоненты.
- Формировать архитектурные и инженерные стандарты для безопасности, разграничения прав, версионирования, тестирования, публикации, аудита и сопровождения компонентов AI-платформы.
- Взаимодействовать с внутренними пользователями и инженерными командами, превращая их потребности в работающие платформенные решения.
- Использовать coding agents и другие AI-инструменты для ускорения разработки, исследований, тестирования и подготовки документации, отвечая за качество результата.
- Основные требования:
- Сильная инженерная база и опыт проектирования промышленных программных систем.
- Опыт работы с LLM, ML-инфраструктурой, распределёнными системами, высокопроизводительными вычислениями или сопоставимыми по сложности технологиями.
- Понимание ключевых аспектов LLM-инференса: latency, throughput, batching, concurrency, длина контекста, потребление памяти, квантизация, параллелизм и KV-кэш.
- Опыт эксплуатации Linux-сервисов, контейнеров, систем мониторинга и современных практик развёртывания.
- Понимание принципов распределённых систем: маршрутизация, балансировка, backpressure, admission control, retries, тайм-ауты, планирование ресурсов и отказоустойчивость.
- Умение проектировать API, границы сервисов, потоки данных и эксплуатационные интерфейсы.
- Уверенное владение хотя бы одним универсальным языком программирования; Python будет преимуществом.
- Навыки диагностики проблем производительности и надёжности на уровнях приложения, инфраструктуры, ОС, сети и GPU.
- Опыт создания сопровождаемых систем с автоматизированным тестированием, code review, документацией, мониторингом и контролируемым выпуском изменений.
- Практический опыт работы с coding agents или другими LLM-инструментами разработки: декомпозиция задач, подготовка контекста, проверка кода, тестирование, отладка и валидация результата.
- Будет преимуществом опыт:
- Промышленного запуска open-weight LLM на SGLang, vLLM, TensorRT-LLM, TGI или аналогичных решениях.
- Эксплуатации крупных dense- и MoE-моделей на многопроцессорных GPU-системах; понимание tensor, pipeline, data, expert и sequence parallelism.
- Опыт применения квантизации, speculative decoding, prefix caching, многоуровневого KV-cache и disaggregated inference.
- Проектирования или эксплуатации OpenAI-совместимых API, потоковой генерации, structured output, tool calling, reasoning-моделей и продолжительных агентных сценариев.
- Разработки маршрутизации между моделями, cache-aware routing, динамического выбора моделей, квот, приоритетов и управления многопользовательской нагрузкой.
- Оценки coding-моделей, coding agents, tool-use и многошаговых агентных сценариев.
- Разработки агентов, агентных рантаймов, MCP-клиентов и серверов, workflow-движков, портируемых скиллов и интеграций с агентными фреймворками.
- Обеспечения безопасности агентных систем: управление учётными данными и правами, sandboxing, изоляция данных, approval flows, аудит и безопасность цепочки поставки.
- Внедрения решений в крупных корпоративных или изолированных средах с повышенными требованиями к безопасности, соответствию регламентам, идентификации пользователей и сетевому доступу.
- Опыт работы с Kubernetes, Docker Compose, Docker Swarm, Prometheus, Grafana, OpenTelemetry или аналогичными технологиями.
- Участия в open-source-проектах, публикация технических материалов, создание публичных бенчмарков или разработка внутренних платформенных решений.
- Что для нас важно:
- Инженерное мышление и независимость от конкретных фреймворков, вендоров и стеков.
- Принятие решений на основе измерений, экспериментов и проверяемых данных.
- Интерес к новым технологиям в сочетании со здоровым скептицизмом.
- Умение быстро создавать прототипы и переводить успешные решения в надёжную промышленную эксплуатацию.
- Понимание, что AI-платформа включает не только запуск моделей, но и API, маршрутизацию, безопасность, доступы, governance, developer experience, оценку качества, мониторинг и эксплуатацию.
- Готовность переключаться между исследованиями, архитектурой, разработкой, оптимизацией и решением производственных проблем.
- Умение работать в команде, делиться знаниями и формировать общие инженерные практики.
Что предлагаем
Стек и инструменты
Подходит ли вам эта вакансия?
Зарегистрируйтесь и загрузите резюме — посчитаем % совпадения с этой вакансией, подсветим сильные стороны и что стоит подтянуть
Похожие вакансии
6 вакансий
Старший Data Scientist
Старший дата-сайентист для AI-проекта в Лондоне (гибрид). Нужно строить модели машинного обучения и LLM-пайплайны для анализа промышленных данных. Требуется сильный Python и опыт продакшн-моделей. Контракт на 2-3 месяца с возможностью продления.
Старший инженер данных (Senior Data Engineer)
~2 571 147 – 3 651 774 ₸ оценка
Старший инженер данных для проекта по AI-трансформации страховой отрасли. Нужно строить конвейеры обработки неструктурированных документов (PDF, сканы) с использованием OCR, Python и AWS, а также проектировать RAG-механизмы. Требуется опыт работы с облачными платформами и векторными базами данных. Компания предлагает удаленную работу, участие в международных проектах и современный стек.
Старший AI инженер
~2 571 147 – 3 651 774 ₸ оценка
Старший AI-инженер для проектов в банковской сфере: разработка автономных AI-агентов и мультиагентных систем на Python с интеграцией LLM. Требуется опыт с LangChain, MLOps и облаком (AWS). Предлагают работу над высокотехнологичными проектами с международными клиентами.
Data Architect (Azure/Databricks)
~2 571 147 – 3 651 774 ₸ оценка
Ищем опытного Data Architect для долгосрочного удаленного проекта с крупной международной компанией. Нужен практический опыт проектирования архитектуры данных на Azure (Databricks, Synapse, ADF) и принятия архитектурных решений. Предлагают контракт на год с почасовой оплатой и полную удаленку.
Data Engineer (Snowflake, dbt)
Ищем опытного Data Engineer для работы над корпоративной платформой данных в американской финтех-компании. Вы будете строить пайплайны на Snowflake, мигрировать Alteryx-процессы и внедрять практики качества данных. Требуется 4+ года опыта, уверенное знание SQL и dbt, а также английский на уровне B2 и выше. Предлагают удаленную работу, обучение и гибкий график.
Data Analyst / DWH Analyst
NovaPay, фінтех-компанія з групи NOVA, шукає аналітика даних з досвідом від 3 років. Потрібно працювати з SQL (PostgreSQL/MS SQL/Oracle), сховищами даних, ETL, оптимізувати БД та створювати аналітичні звіти. Компанія пропонує гібридний формат, віддалену роботу, медичне страхування та можливості для розвитку.