Задачи:
— развивать real-time антибот и антифрод: детектировать ботов и фрод с помощью потоковых эвристик, разрабатывать новые сигналы
— развивать обогащение событий: строить операторы обогащения кликстрим-событий (геолокация, категории, атрибуты пользователя, рекламные метрики)
— развивать CDC и data ingestion: разрабатывать пайплайны захвата изменений из БД и доставки данных в DWH в формате Apache Paimon
— развивать рекламную аналитику: считать CTR impressions, auction withdrawals и маркетинговые конверсии в реальном времени
— развивать Flink Platform: управлять Flink Kubernetes Operator, Helm-чартами, деплоями в нескольких дата-центрах и регионах
— обеспечивать техническое лидерство команды: задавать архитектурные стандарты и помогать команде расти
Требования:
— обладаете глубокой экспертизой в Apache Flink или другом фреймворке потоковой обработки данных (Spark Streaming, Kafka Streams)
— обладаете опытом руководства командой разработки от 4-х лет
— используете системный подход к работе с людьми (мотивация, развитие, адаптация)
— работали с высоконагруженными продакшен-системами
— умеете декомпозировать задачи и выстраивать технический роадмап
— понимаете принципы работы Apache Kafka и распределённых систем
— будет плюсом: имеете опыт руководства платформенной командой без продакт-менеджера и системного аналитика
ASOS.com — британский онлайн‑ритейлер модной одежды, обуви, аксессуаров и косметики. В компании работают русскоговорящие ребята.
Технологии и инструменты: SQL, Databricks, Spark, DBT, Python, Mixpanel, Adobe и другие.
Компания основана фаундерами Nick Robertson, Andrew Regan, Quentin Griffiths, Deborah Thorpe.
Размер команды: 1k-5k человек. Инвестиции: £587.5M.
– Разработка, создание и поддержка надежных конвейеров обработки данных и процессов ETL/ELT для поддержки различных источников данных, включая структурированные и неструктурированные данные, с обеспечением высокого качества и целостности данных. Хороший опыт работы с Databricks.
Supporting federal customer engagements by delivering mission-aligned architectural design and execution of Collibra products that adhere to Collibra Public Sector’s Delivery Models, Engagement Processes, Methodologies, and Artifacts, while ensuring compliance with applicable government regulations and security standards (e.g., FedRAMP, FISMA, GovCloud).
Build the execution engine: Design, implement, test, and support query operators, expression evaluation, execution scheduling, runtime planning, and resource management. Improve runtime performance: Optimize vectorized processing, concurrency, parallelism, memory usage, data exchange, and disk spilling.
• Разработка моделей эластичности для различных групп клиентов, кластеризации клиентов по их поведенческим характеристикам. • Разработка поведенческих моделей для прогнозирования динамики объемов различных сегментов розничного портфеля Банка в множестве сценариев на периоде жизни портфеля.
Требования:
— Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек)
— Глубокий SQL: оконные функции, сложные джойны, иерархические запросы
— Оптимизация SQL для highload (партиционирование, индексы, explain plans)
— Oracle (PL/SQL) и PostgreSQL
— Greenplum и/или Clickhouse
— Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow
— Hadoop (HDFS) и Hive
— Мониторинг ETL: Grafana/Prometheus или Victoria Metrics
— Опыт работы с биллинговыми системами (желательно телеком-домен)
Преимущества:
— Потоковая обработка: Kafka Streams / Spark Streaming
— Informatica PowerCenter (понимание мигрируемой системы)
— Бинарные форматы хранения в Hadoop
— Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL
— Patroni для кластеризации PostgreSQL/Greenplum
— S3-хранилища
— КриптоПро или защищенные каналы передачи данных
Задачи:
— Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum)
— Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код
— Написание и оптимизация SQL для витрин данных и ETL-процессов
— Разработка DAG-ов в Airflow
— Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы)
— Разработка Spark-джобов (PySpark) для больших объемов
— Интеграция с Kafka для потоковой передачи
— Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик
— Разбор инцидентов по качеству данных и ошибкам загрузки
— Code review
О нас за минуту
DV Group — это eRetail маркетинг. У нас две собственные платформы:
CDP (DV Platform) — сегментирует покупателей по чековым данным, MAID, строит Sales Lift.
DSP (DV Programmatic) — закупает трафик в RTB с таргетингом на реальных онлайн-покупателей (не на интересы). Уникальная интеграция с ПБД.
Что предстоит делать
Разработка и внедрение ML-моделей
Анализ больших объемов данных
Построение recommendation / prediction моделей
Подготовка и очистка данных
Проведение A/B тестов
Написание сложных запросов ClickHouse и их оптимизация
Взаимодействие с frontend-разработчиками, backend-разработчиками, аналитиками, product-менеджером и DevOps
Кто нам нужен
Python, SQL, Spark, ClickHouse
pandas, numpy, scikit-learn
Опыт работы с ML-моделями
Работа с оркестраторами (Dagster, Airflow) и Kubernetes
Понимание статистики и теории вероятностей
Способность разрабатывать надежные ETL пайплайны
Что предлагаем
Зарплата:
200 000 – 220 000 ₽ оклад net + годовая премия
Формат:
гибрид или полная удалёнка, но ты проживаешь в РФ
График:
10:00–19:00
ДМС
со стоматологией после испытательного срока, локация Москва
Свой
бариста
в офисе и правда классный
Экспертная среда
— никакой скуки, только реальные AdTech-задачи и возможность влиять на продукт
Продукт в
реестре отечественного ПО
— это важно для нас и для клиентов.
As the Senior Staff Machine Learning Platform Engineer, you will own the technical vision and evolution of Faire’s ML platform. You will set standards, influence org-wide architecture, and lead complex, cross-functional initiatives that unlock data science velocity at scale.
🔭Чем у нас занимаются стажеры? - Сразу после этого получают свою первую настоящую боевую задачку (и НЕ страдают, так как ментор всегда под рукой) на дизайн или оценку будущего эксперимента.
-Design, build, and maintain data infrastructure and pipelines spanning both batch and real-time / streaming workloads, contributing to architectural decisions along the way. -Build and maintain scalable, efficient, and reliable ETL/ELT pipelines using languages and frameworks such as Python, SQL, Spark, Flink, Beam, or equivalents.