Проект: команда развивает аналитические продукты и сервисы для внутренних пользователей и внешних клиентов Экосистемы банка. В рамках направления участвуют в развитии внутреннего продукта – Корпоративное хранилище данных на платформах Hadoop и Greenplum. Данные используются аналитиками банка для управленческой отчетности, моделирования, data science и автоматизированных процессов. Используются данные внутренних систем банка и внешних источников (Единый государственный реестр ЮЛ/ИП, база арбитражных дел, портал госзакупок и др.).
Используемые инструменты: Hadoop, Greenplum, Oozie, Airflow, Nifi, Bash, Scala, Spark, Hive, Git, Jenkins, SonarQube.
Требования: опыт работы со Scala и sbt, стеком технологий Hadoop (HDFS, Hive, Spark версии 2 и выше, spark SQL).
Задачи:
— разработка ETL потоков на платформе Hadoop (Scala + Spark SQL);
— поиск возможностей оптимизации, повышение скорости расчёта и эффективности использования вычислительных ресурсов;
— повышение стабильности работы приложений, анализ типовых ошибок и рисков, развитие системы логирования для промышленной эксплуатации, участие в решении инцидентов;
— развитие системы контроля качества и автотестов.
Условия:
— возможность участия в интересном проекте;
— профессиональный и карьерный рост в компании;
— опыт работы в команде профессионалов;
— уровень заработной платы обсуждается индивидуально;
— формат работы офисный/гибридный в Москве;
— перспективы профессионального развития в России и зарубежных представительствах.
Компания Aston приглашает на позицию Дата инженер (ученик) с последующим трудоустройством.
Задачи:
— пройти онлайн-интенсив длительностью 1 месяц, изучая теорию и выполняя практические задания;
— совмещать обучение с работой;
— после успешного окончания интенсива зачисление на стажировку в Лабораторию ASTON;
— обучение на стажировке 3-4 месяца, 5 дней в неделю с 9:00 до 18:00 с перерывом на обед;
— изучение теории с еженедельными проверками;
— практика на учебных проектах под руководством опытного технического руководителя;
— подготовка к собеседованию и самопрезентации;
— посещение офиса обязательно для кандидатов, где есть офис компании;
— для кандидатов из городов без офиса обучение возможно удаленно;
— после старта на коммерческом проекте формат работы гибридный (3 дня в офисе ASTON, 2 дня удаленно) до уровня М2, затем полное посещение офиса заказчика;
— возможны командировки в Санкт-Петербург или Москву.
Требования:
— законченное высшее или среднее специальное профильное образование;
— готовность пройти стажировку в компании ASTON.
Условия:
— выплата стипендии во время обучения;
— официальное трудоустройство;
— доступ к корпоративной программе обучения;
— регулярный пересмотр и повышение зарплаты после выхода на проект;
— гарантированный финансовый бонус при старте на коммерческом проекте;
— офис в центре города, корпоративные мероприятия, частичная компенсация спортивных абонементов.
Требуемые навыки: визуализация, математическая статистика, NoSQL, Apache Hadoop, Greenplum, базы данных, Agile, Python, SQL.
– Анализировать готовые бизнес-требования и собирать дополнительные требования непосредственно у заказчиков; – Создавать и декомпозировать задачи в Kaiten;
Удалённоmiddle
Зарплата не указана
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Задачи:
— Разрабатывать и поддерживать ML-модели полного цикла — онбординговые и транзакционные — на кредитных продуктах Ozon Банка;
— Анализировать большие объёмы данных для обнаружения аномалий и паттернов мошенничества;
— Участвовать в развитии графовой аналитики антифрода — R&D и прикладное использование;
— Настраивать мониторинг продакшн-моделей: алерты, анализ дрейфа, реакция на инциденты, процессы;
— Интегрировать внешние источники скоров (телеком, БКИ и т.п.) — от оценки экономики поставщика до организации ретро и коммуникации с закупками и юристами;
— Работать напрямую с заказчиками, доводить задачи до измеримого результата и экономического эффекта;
— Участвовать в создании реалтайм ML-сервисов и правил-эвристик;
— Автоматизировать процессы обработки и анализа данных.
Требования:
— Опыт работы в Data Science от 3 лет, из них минимум 1-2 года в антифроде, кредитном скоринге или близких задачах — в банке или финтехе;
— Уверенное владение Python и библиотеками для анализа данных и машинного обучения;
— Глубокое понимание алгоритмов машинного обучения и опыт их применения на практике;
— Полный жизненный цикл ML — от фича-инжиниринга до деплоя и мониторинга в проде;
— Опыт с MLflow или аналогом;
— Отличные знания SQL, умение писать сложные запросы, включая оконные функции;
— Опыт работы с большими данными — ClickHouse / Vertica / Spark / Hadoop;
— Бизнес-ориентированность — умение считать экономический эффект модели и объяснять заказчику технические метрики на языке бизнеса;
— Самостоятельность в проектах — способность взять кейс с нуля и довести до прода без постоянного контроля;
— Умение работать с данными и видеть закономерности и людей за ними;
— Навыки работы с инструментами визуализации данных;
— Гибкость и умение быстро переключаться между задачами.
Будет плюсом:
— Опыт построения realtime-моделей и их интеграции в продукты;
— Опыт с графовыми методами и графовыми БД;
— Опыт интеграции и переговоров с внешними поставщиками скоров;
— Опыт наставничества и менторинга младших сотрудников;
— Знание регуляторики ЦБ в части антифрода.
Задачи:
— работать с большими данными в экосистеме Hadoop (PySpark, SQL) — от выгрузки и разведки до построения витрин для моделей
— разрабатывать индивидуальные модели эластичности и клиентского поведения в сегменте B2C — от прототипа до продвинутого пайплайна обучения и предсказаний
— проверять бизнес-гипотезы и превращать их в измеримый эффект: дизайн и оценка A/B-тестов (мэтчинг, продвинутые методы causal inference, интерпретация результатов)
— выстраивать коммуникацию с заказчиками: согласовывать метрики, защищать подходы, показывать ценность данных на понятном языке
— обеспечивать надёжность и мониторинг внедрённых решений — чтобы модель работала стабильно и приносила пользу каждый день.
Требования:
— опыт работы Data Scientist от 2х лет
— техническое образование (будет плюсом если выпускник - МГУ, МФТИ, ВШЭ и других ведущих вузов страны)
— понимание теории вероятностей и статистики
— уверенное владение широким спектром ML-алгоритмов — регрессия, классификация, кластеризация, а также uplift-моделирование (способность оценивать причинно-следственные эффекты, а не просто предсказывать)
— владение Python и ML библиотеками (numpy, sklearn, pandas, matplotlib/seaborn/plotly, catboost/lightgbm/xgboost, etc.)
— плюсом будет опыт работы с pytorch, pyspark
Условия:
— комфортный современный офис рядом с м. Кутузовская
— возможность выбрать удобный график – офис/гибрид
— ежегодный пересмотр зарплаты, квартальная и годовая премия (премия указывается в зависимости от должности и системы премирования)
— корпоративный спортзал и зоны отдыха
— более 400 образовательных программ СберУниверситета для профессионального и карьерного развития
— программа адаптации и помощь руководителя на старте (для вакансий уровня Junior)
— расширенный ДМС, льготное страхование для семьи и корпоративная пенсионная программа
— гибкий дисконт по ипотечному кредиту, равный 1/3 ключевой ставки ЦБ
— подписка Прайм с возможностью совместного использования на трёх близких
— вознаграждение за рекомендацию друзей в команду Сбера.
Supporting federal customer engagements by delivering mission-aligned architectural design and execution of Collibra products that adhere to Collibra Public Sector’s Delivery Models, Engagement Processes, Methodologies, and Artifacts, while ensuring compliance with applicable government regulations and security standards (e.g., FedRAMP, FISMA, GovCloud).
Build the execution engine: Design, implement, test, and support query operators, expression evaluation, execution scheduling, runtime planning, and resource management. Improve runtime performance: Optimize vectorized processing, concurrency, parallelism, memory usage, data exchange, and disk spilling.
Поддержкой, оптимизацией и развитием платформы потоковой обработки данных на базе Apache Flink. Настройкой и администрированием Flink, Kafka, Hadoop и Elasticsearch.
• Разработка моделей эластичности для различных групп клиентов, кластеризации клиентов по их поведенческим характеристикам. • Разработка поведенческих моделей для прогнозирования динамики объемов различных сегментов розничного портфеля Банка в множестве сценариев на периоде жизни портфеля.
Требования:
— Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек)
— Глубокий SQL: оконные функции, сложные джойны, иерархические запросы
— Оптимизация SQL для highload (партиционирование, индексы, explain plans)
— Oracle (PL/SQL) и PostgreSQL
— Greenplum и/или Clickhouse
— Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow
— Hadoop (HDFS) и Hive
— Мониторинг ETL: Grafana/Prometheus или Victoria Metrics
— Опыт работы с биллинговыми системами (желательно телеком-домен)
Преимущества:
— Потоковая обработка: Kafka Streams / Spark Streaming
— Informatica PowerCenter (понимание мигрируемой системы)
— Бинарные форматы хранения в Hadoop
— Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL
— Patroni для кластеризации PostgreSQL/Greenplum
— S3-хранилища
— КриптоПро или защищенные каналы передачи данных
Задачи:
— Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum)
— Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код
— Написание и оптимизация SQL для витрин данных и ETL-процессов
— Разработка DAG-ов в Airflow
— Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы)
— Разработка Spark-джобов (PySpark) для больших объемов
— Интеграция с Kafka для потоковой передачи
— Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик
— Разбор инцидентов по качеству данных и ошибкам загрузки
— Code review
🔭Чем у нас занимаются стажеры? - Сразу после этого получают свою первую настоящую боевую задачку (и НЕ страдают, так как ментор всегда под рукой) на дизайн или оценку будущего эксперимента.
– выполнять задачи полного жизненного цикла: от сбора требований до выкатки на установку в прод; – разрабатывать и дорабатывать витрины и решения, автоматизировать их через оркестраторы;
Разработка ML-моделей/rule-based/иных решений под поставленные задачи, поиск/лидирование разметки данных для обучения, покрытие мониторинговыми метриками, близкими к продуктовым. Классификация позиций в чеках по древовидному каталогу.