Перейти к содержимому
Дарига Шокаева

Дарига Шокаева

ML инженер

Офис Удалённо Гибрид Астана, Казахстан
2 г. 7 мес. опыта 34 навыка

О себе

Исследователь в области искусственного интеллекта с практическим опытом в компьютерном зрении и обработке естественного языка, включая проекты по генерации 3D‑лиц по текстовому описанию и разработке моделей для автоматизированного суммирования научных статей. Уверенно владею Python, PyTorch и современными фреймворками машинного обучения, обладаю сильной базой в deep learning и data engineering. Имею опыт распределённого обучения на GPU, finetuning large моделей и построения надёжных ML‑pipeline для полного цикла разработки.

Опыт работы

MBZUAI

05.2023 — 01.2024 8 мес.

AI Undergraduate Research Intern, Computer Vision

Стажёр Гибрид UAE

Усовершенствовала GenAI‑модель генерации 3D‑лиц по текстовому описанию, сосредоточившись на интеграции 2D‑в‑3D генерации, под руководством профессора Хао Ли в MBZUAI (университет входит в топ‑18 мировых исследовательских центров по компьютерному зрению по данным CSRankings).

Zendy

06.2023 — 08.2023 2 мес.

Data Engineering Intern, NLP

Стажёр Офис UAE

Реализовала модель для краткого изложения научных статей с использованием distributed learning на GPU. Разработала PyTorch‑скрипт для finetuning на собственно собранном датасете из более чем 250 тыс. записей, применяя методы NLP и deep learning.

New York University

08.2021 — 05.2023 1 г. 9 мес.

Student Assistant (Multiple positions)

Офис USA & UAE

Ассистентка преподавателя: проверяла задания и предоставляла обратную связь более чем 30 студентам на курсе по ООП. Ассистентка исследователя: помогала в сборе данных и разработке ML‑модели генерации кода по текстовому описанию.

Проекты

Fair Post-HCT Survival Prediction Modeling

Добилась абсолютного прироста метрики на +0.014 (с 0.669 до 0.683) на публичном лидерборде Kaggle. Руководила проведением более 20 экспериментов по feature engineering и оптимизации ансамблей GBDT‑моделей (CatBoost/XGBoost/LightGBM).

BirdCLEF+ 2025 — Multi-Species Audio Recognition

Усовершенствовала аудио‑пайплайн Audio → Mel → CNN за счёт удаления речи, обрезки тишины и ансамбля EfficientNet‑B0. Добавила полу‑контролируемое обучение, сгенерировав высокоуверенные метки для неразмеченного аудио (+6 200 сегментов). Улучшила результаты команды на лидерборде Kaggle: с 0.761 до 0.810 на публичном и с 0.748 до 0.812 на приватном.

Column Name-Wikidata Property Linker

Разработала масштабируемую систему entity linking, обрабатывающую более 3.5 тыс. свойств Wikidata с кастомной генерацией датасета. Реализовала deployment-ready мультиклассовую систему классификации на основе модели RoBERTa, достигнув точности 86 %.

Text-to-3D Face Generation Application

В составе команды разработала систему, генерирующую точные 3D‑лица по текстовым промптам пользователей за время менее 30 секунд на лицо. Построила сквозную (end‑to‑end) систему генеративного ИИ, объединяющую несколько ML‑моделей и внешние API для реалтайм‑генерации 3D‑лиц из текста.

Образование

Erasmus Mundus Master's in AI (EMAI) - UPF, Radboud, UCL, & Sapienza

2024 — 2026

Artificial Intelligence

Магистр

New York University Abu Dhabi

2020 — 2024

Computer Science

Бакалавр

Награды

Erasmus Mundus AI Scholarship

1 of 15 Awardees Selected from 1,300+ Applicants (≈1.2% acceptance)

MBZUAI Undergraduate Research Internship Best Presentation

Top 1 among 10+ Teams

NYUAD Quantum Hackathon for Social Good 2022

Best Social Good Applied to the Region

2022

NYU Stern School of Business PPDS Best Final Project

Top 1 out of 10 Teams

Навыки

Python PyTorch Machine Learning Deep Learning NLP Sklearn TensorFlow SQL Data Engineering Research Computer Vision Gradient Boosting Ensemble Learning CatBoost XGBoost LightGBM EfficientNet-B0 Silero VAD RoBERTa Gradio AWS Sagemaker Docker Flask Pytest CI/CD Git C++ C JavaScript Java Qa AI backend Data Science

Языки

English Родной
Russian Родной
Kazakh Родной
French A1 — Начальный
Spanish A1 — Начальный

Личные данные

Возраст 25 года