Ищем Lead Data Scientist, который будет развивать ML-решения для рекламной монетизации, персонализации и рекомендаций, а также вести и менторить Data Science-команду. • 5+ лет опыта в Data Science, желательно в consumer mobile-продуктах.
Задачи:
— Руководство и наставничество в командах Data Science
Требования:
— Опыт работы в Data Science не менее 5 лет, предпочтительно в мобильных потребительских продуктах
— Глубокие знания в области монетизации рекламы, оптимизации доходов или аналитики рекламы
— Опыт работы с системами рекомендаций, персонализации или ранжирования
— Продвинутые навыки Python и SQL
— Экспертиза в машинном обучении, предиктивном моделировании, прогнозировании и прикладной статистике
— Опыт работы с большими поведенческими наборами данных
— Опыт руководства или наставничества в командах Data Science
— Родной русский язык
Будет преимуществом:
— Знание AdMob, AppLovin, Unity Ads, ironSource
— Опыт с MLOps и облачными платформами AWS, GCP, Azure
— Знания в области LLM и генеративного ИИ
Задачи:
– проектирование и разработка слоев данных (Raw, Clean, Enriched/Presentation) с учетом лучших практик моделирования (Data Vault 2.0 / 3NF для хранилища, Star Schema для витрин);
– разработка и внедрение кастомных алгоритмов дедупликации и Entity Resolution (Fuzzy Matching) на Python;
– формализация бизнес-правил качества данных в код, настройка уровней доверия к источникам и правил выживания (survivorship rules);
– внедрение Data Contracts и механизмов карантина (quarantine) для некачественных данных с возможностью их последующего разбора;
– настройка автоматизированного тестирования данных (Data Quality checks) в пайплайнах.
Требования:
– Продвинутый уровень SQL и опыт работы с dbt (или аналогами) для построения слоев данных;
– уверенное владение PySpark и/или pandas для обработки больших объемов данных и реализации логики матчинга;
– практический опыт применения библиотек нечёткого поиска и связывания записей (Splink, recordlinkage, dedupe, theFuzz);
– понимание принципов работы алгоритмов сравнения строк (Левенштейн, Джаро-Винклер, косинусное сходство на TF-IDF/эмбеддингах);
– глубокое понимание 2-3NF, Data Vault 2.0 и различий между слоями сырых, очищенных и обогащенных данных;
– опыт внедрения инструментов тестирования данных (Great Expectations, Soda, dbt tests, deequ или аналоги);
– опыт работы с оркестраторами (Airflow, Dagster или Prefect), уверенное использование Git и базовые навыки CI/CD для дата-пайплайнов.
Удалённо
Зарплата не указана
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Задачи:
— Исследование и разработка LLM: полный цикл работы с языковыми моделями от гипотез и экспериментов до оптимизации и внедрения в продакшен.
— Проведение A/B-экспериментов: валидировать гипотезы через масштабные A/B-тесты, анализировать влияние на ключевые продуктовые и бизнес-метрики.
— Работа с продуктом: взаимодействовать с инженерами и продакт-менеджерами для превращения исследовательских решений в рабочие фичи.
— Анализ и оптимизация: отслеживать качество моделей, искать точки роста и устранять слепые зоны в данных и алгоритмах для улучшения ключевых метрик.
Требования:
— Хорошее знание основ современного ML и DL.
— Готовность работать с большими данными и распределёнными вычислениями.
— Желание заниматься прикладными ML-исследованиями.
— Практический опыт в NLP или RecSys.
Условия:
— Ежегодные медицинские чекапы, йога и психотерапия, а также другие бонусы.
Задачи:
— Разработка и развитие сервисов промышленного инференса ML-моделей и LLM
— Построение централизованного слоя доступа к моделям и AI-сервисам
— Разработка платформенных компонентов для деплоя, версионирования и мониторинга моделей
Требования:
- Опыт TeamLead (управление командой) не менее 4 лет;
- Опыт разработки ETL/ELT-процессов, в которых значительная часть логики реализована на стороне СУБД;
- Опыт разработки и сопровождения хранимых процедур / функций в СУБД;
- Практический опыт использования SQL/PLSQL или аналогичных процедурных расширений SQL для реализации загрузок и трансформаций данных;
- Опыт участия в проектах миграции ETL-систем (Apache стек);
- Опыт разработки на Python (написание ETL-скриптов, работа с pandas, интеграция с API);
- Опыт написания и отладки DAG'ов в Apache Airflow (не только проектирование, но и разработка);
- Опыт работы с PySpark (трансформации, оптимизация, партиционирование);
- Опыт миграции ETL-процессов с Informatica PowerCenter на открытый стек (Airflow + Greenplum);
- Глубокое практическое знание NiFi и Airflow: проектирование потоков, подключение источников, обработка ошибок, мониторинг, отладка;
- Опыт работы с качеством данных: разработка правил валидации, анализ влияния на бизнес-процессы;
- Понимание архитектурных подходов к проектированию хранилищ, различие ETL и ELT;
- Опыт работы с Hive metastore (устройство, хранение на PostgreSQL) и форматами файлов (Parquet, ORC);
- Опыт работы с Оracle;
- Опыт применения сложных SQL-запросов (оконные функции, джоины);
- Умение оптимизировать запросы для highload-среды;
- Опыт проектирования интеграций Apache-стека с Kafka и BI-системами;
- Опыт настройки потоковой обработки данных;
- Опыт работы с Hadoop и Hive (знание версий, источников данных);
- Опыт работы с PostgreSQL, Greenplum, Clickhouse;
- Опыт работы с Grafana/Prometheus для отслеживания ETL-процессов;
- Опыт работы с биллингом;
- Опыт автоматической валидации и контроля качества данных после миграции (сравнение результатов, метрики);
Обязанности:
- Миграция ETL-процессов с Informatica PowerCenter на целевой стек: NiFi + Airflow + Greenplum + SQL/хранимые процедуры.
- Подготовка документации AS IS и TO BE;
- Написание SQL кода;
- Отслеживание метрик.
Задачи:
- Проводить проектную коммуникацию с представителями бизнес-заказчика с целью уточнения бизнес-требований
- Выявлять и проводить анализ бизнес-требований, потребностей и проблем бизнес-заказчика
- Формировать спецификации требований, описание логических моделей, структур данных и проектных решений (хранилища и витрины данных)
- Согласовывать проектные решения с архитекторами, разработчиками и аналитиками смежных команд
- Проектировать и разрабатывать ETL/ELT процессы, слои хранилища и витрины данных
- Разрабатывать и оптимизировать SQL-запросы
- Проводить внутреннее тестирование и контроль качества информационных продуктов, реализованных разработчиками
- Принимать участие в приёмочных испытаниях информационных продуктов и документации с заказчиками
- Обеспечивать контроль качества данных и их целостность
Требования:
- Высшее образование: техническое, математическое или финансовое
- Опыт работы не менее 5 лет
- Уверенные знания Python, GIT, Airflow (DAG с декомпозицией задач, зависимостями, сенсорами)
- Глубокое знание SQL: оконные функции, процедуры, функции, вложенные запросы, опыт оптимизации запросов
- Понимание индексов, партиций, ключей, нормальных форм, SCD
- Понимание моделирования данных, построения хранилища, репликации и консистентности данных
- Умение рефакторить код и проводить миграцию из одной системы в другую
- Знание принципов CI/CD
- Знание PL/SQL для Oracle, Postgres, Greenplum или знание иной MPP СУБД (будет плюсом)
- Опыт работы с API (будет плюсом)
- Знание ООП, DBT, Kafka, Bash, SAS (будет плюсом)
Задачи:
- Развивать ядро матчинга: retrieval кандидатов по текстовым, картиночным и мультимодальным эмбеддингам, обучать модели классификации пар, работать с атрибутами товаров
- Улучшать NLP-часть пайплайна с учетом специфики оптовых товаров: обработка названий, извлечение атрибутов из описаний, дообучение эмбеддинг-моделей
- Доводить решения до прода и отвечать за них
Требования:
- Сильное понимание NLP: трансформерные модели, эмбеддинги, векторный поиск, опыт дообучения моделей под свою задачу
- Опыт в задачах матчинга
- Опыт в Data Science и ML Engineering с выводом моделей в продакшен от 3-х лет
- Уверенные знания Python, ML-стека, SQL
- Умение выбирать решение под задачу: не использовать нейросеть там, где достаточно эвристики, и наоборот
- Опыт с CV и мультимодальными моделями (CLIP-подобные, metric learning), LLM/VLM в задачах классификации/ранжирования будет плюсом
Задачи:
— Строить и развивать аналитическое хранилище компании на базе BigQuery.
— Настраивать конвейеры данных из продуктовых и маркетинговых источников (AppsFlyer, Adjust, RevenueCat, Amplitude, Mixpanel, Facebook Ads и др.).
— Формировать данные в удобный для аналитиков и продуктовых менеджеров вид.
— Документировать модель данных.
— Внедрять лучшие практики работы с хранилищем: слоистая архитектура (raw / staging / marts), соглашения по наименованиям, версионирование, тесты качества данных.
— Взаимодействовать с продуктом, маркетингом и аналитикой для понимания бизнес-требований и трансформации их в структуру данных.
Требования:
— Опыт работы в data engineering от 2 лет или сильная аналитическая роль с реальным инженерным компонентом (уровень solid junior / light middle).
— Уверенное владение Python для написания ETL/ELT скриптов, работы с API и автоматизации конвейеров.
— Опыт работы с GCP (BigQuery, Cloud Functions, Cloud Storage).
— Уверенный уровень SQL: оконные функции, CTE, оптимизация запросов.
— Понимание принципов аналитических хранилищ: слоистая архитектура, нормализация/денормализация, идемпотентность конвейеров, инкрементальные загрузки.
— Опыт интеграции данных из внешних источников через API или готовые коннекторы.
— Сильные коммуникативные навыки для общения с нетехническими стейкхолдерами, умение задавать уточняющие вопросы и объяснять технические ограничения простым языком.
— Опыт работы с Git: ветвление, код-ревью.
Желательно:
— Опыт с типичными источниками подписочного/мобильного стека: AppsFlyer, Adjust, Adapty, Amplitude, Mixpanel.
— Понимание специфики мобильной атрибуции: SKAdNetwork, постбеки, детерминистическая и вероятностная атрибуция.
— Опыт работы с BI-инструментами (Looker Studio, Metabase, Tableau, Power BI) на уровне настройки источника и построения дашбордов.
— Знания Terraform / IaC для ресурсов GCP.
— Опыт с CDC / стримингом (Pub/Sub, Dataflow) — плюс, но не критично.
Условия:
— Гибридный формат работы: 2 дня в офисе в Варшаве, 3 дня удаленно.
— Обеды оплачиваются в офисные дни.
— Возможность участвовать в командных мероприятиях.
— Гибкий график с фокусом на результат.
— Работа в молодой команде с энергией стартапа, без бюрократии и микроменеджмента.
Задачи:
— Определить, что считается качеством модели: метрика, горизонт, baseline, калибровка, и довести предикт до этого уровня
— Интегрировать A/B-тесты пейволлов с предиктом, учитывая, что тест измеряет краткосрочный эффект, а раскатывать нужно по долгосрочной выручке
— Развить аналитику, выявить и устранить узкие места в данных, запросах или интерфейсе
— Принять решение по накопленным ML-наработкам: что доводить до продукта, что закрывать
— Руководить командой из двух ML-инженеров
Требования:
— Глубокие знания классического ML и математической статистики, способность вести предметный спор о метриках и горизонтах прогнозирования
— Владение SQL и Python для самостоятельного извлечения и проверки данных
— Умение самостоятельно вести широкое направление и доводить его до результата без необходимости постановки задач
— Продуктовый опыт является плюсом, но не обязателен
Плюсы:
— Опыт с подписками, мобильными приложениями или финтехом (LTV, churn, когортная экономика)
— Знания в области экспериментального дизайна: мощность теста, MDE, множественные сравнения
— Опыт работы с ClickHouse
— Участие в олимпиадах, Kaggle, наличие публичных проектов
О компании:
Adapty — платформа монетизации подписок для мобильных приложений, через которую проходит более $3 млрд подписочной выручки в год, используется более 20 000 приложений. В компании формируется новое направление аналитики и ML под одного владельца, с целью улучшения точности предсказания LTV для оптимизации расходов на привлечение пользователей.
Требования:
- sql, базы данных, python, аналитический склад ума
Обязанности:
- построение ETL-процессов
- работа с современным стеком трансформации
- оркестрация данных
- управление хранилищами
- визуализация смыслов
- оптимизация выборок
Условия:
Срочный трудовой договор на 3 месяца, удаленно/офис/гибрид.
Стажировка для студентов из любых ВУЗов.
О компании и роли
Продуктовая mobile game-компания с многомиллионной аудиторией и сильной рекламной моделью монетизации.
Ищем Lead Data Scientist, который будет развивать ML-решения для рекламной монетизации, персонализации и рекомендаций, а также вести и менторить Data Science-команду.
Почему стоит рассмотреть
• Влияние на ключевые продуктовые метрики: ad revenue, engagement, retention и LTV
• Большие объёмы behavioral data и реальные production ML-задачи
• Возможность влиять на Data Science roadmap, технические решения и развитие команды
• Работа на стыке Data Science, Product, Engineering и Ad Monetization
Важно
• 5+ лет опыта в Data Science, желательно в consumer / mobile-продуктах
• Обязателен опыт в advertising monetization, revenue optimization или advertising analytics
• Опыт с recommendation, personalization или ranking systems
• Сильный Python и SQL
• Опыт с ML-моделями, A/B-тестированием и applied statistics
• Опыт работы с большими behavioral datasets
• Опыт технического лидерства или менторинга Data Scientists
Задачи:
— развивать ML-решения для рекламной монетизации, персонализации и рекомендаций
— вести и менторить Data Science-команду
Требования:
— 5+ лет опыта в Data Science, желательно в consumer mobile-продуктах
— опыт advertising monetization, revenue optimization или advertising analytics
— опыт разработки recommendation, personalization или ranking systems
— сильные Python и SQL
— практический опыт с ML: classification, regression, ranking, forecasting, predictive modeling
— понимание A/B-тестирования, applied statistics и работы с большими behavioral datasets
— опыт технического лидерства или менторинга Data Scientists
Условия:
— гибридный формат работы (удаленка с обязательным посещением офиса время от времени)
— работа в международной mobile game development-компании
— кросс-функциональная работа с Product, Engineering, Analytics и Ad Monetization
— возможность формировать Data Science-направление, roadmap и технические стандарты команды
— прямое влияние на рекламную выручку, engagement, retention и LTV продукта
Задачи:
– Разработка и оптимизация ETL-процессов с использованием Python и SQL.
– Разработка и внедрение масштабируемых конвейеров обработки данных для обработки различных источников данных.
– Работа с реляционными базами данных (например, PostgreSQL, Oracle) для обеспечения эффективного хранения и извлечения данных.
– Оптимизация SQL-запросов и скриптов Python для повышения производительности и удобства сопровождения.
– Внедрение надежной обработки ошибок, ведение журналов и мониторинг для конвейеров обработки данных.
– Взаимодействие с межфункциональными командами для интеграции и управления источниками данных.
Требования:
– Более 5 лет опыта в области проектирования данных.
– Навыки работы с Python и SQL на экспертном уровне – умение писать эффективный, масштабируемый и поддерживаемый код.
– Обширный опыт в проектировании ETL-процессов и работе с большими массивами данных.
– Глубокое понимание оптимизации производительности баз данных и оптимизации запросов.
– Опыт работы с моделированием данных и проектированием схем.
– Знание решений для облачного хранения данных (Azure, AWS или GCP).
– Высокие навыки решения проблем и способность работать самостоятельно.
– Желательно: опыт работы с PySpark, оркестраторами и знание CI/CD для автоматизации процесса развертывания.
Условия:
– Полностью удаленная позиция с гибкими условиями работы.
Ищем сильного специалиста по табличным данным в команду, которая моделирует спрос и поведение розничного портфеля крупного Банка: оцениваем, как меняется спрос на продукт при изменении его параметров, и переводим это в решения по портфелю.