– Развивать корпоративную платформу данных и DWH; – Переводить существующие ETL-процессы с SSIS на Apache Airflow 3 и внутренний YAML-driven Python-фреймворк;
Зарплата не указана
Загружаем вакансии…
– Развивать корпоративную платформу данных и DWH; – Переводить существующие ETL-процессы с SSIS на Apache Airflow 3 и внутренний YAML-driven Python-фреймворк;
Зарплата не указана
• разрабатывать и оптимизировать SQL-запросы, процедуры, функции, триггеры, views; • работать со структурой БД, индексами и миграциями;
Зарплата не указана
Проектирование и развитие процессов сбора, загрузки, преобразования и передачи данных (ETL/ELT). Разработка и сопровождение пайплайнов обработки больших объемов данных.
от 600 000 ₸
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Задачи: – Разрабатывать и дорабатывать ETL-процессы в Airflow – Подключать новые источники данных – Создавать и дорабатывать витрины – Оптимизировать SQL-запросы в GreenPlum и PostgreSQL – Работать с большими объемами данных – Развивать процессы контроля качества данных Требования: – От 1 года опыта работы с данными – Отличное знание SQL: JOIN, оконные функции, процедуры – Умение профилировать и оптимизировать запросы, понимать план выполнения – Понимание принципов работы реляционных БД и архитектуры DWH: ODS, DDS, DM – Практический опыт работы с Airflow и ETL-процессами – Python на базовом уровне – Знание Linux и умение работать с командной строкой – Опыт работы с Git – Понимание принципов работы Docker
Зарплата не указана
онлайн-интенсив 1 месяц; вы изучаете теорию и отрабатываете ее с помощью практических заданий;
от 73 900 ₽
Задачи: — Проектировать и поддерживать интеграцию источников данных (взаимодействие с процессинговыми системами и Автоматизированной Банковской Системой / АБС); — Организовывать мониторинг актуальности входящих данных и оперативно реагировать на инциденты; — Готовить данные для загрузки в оговоренные форматы хранения (Data Lake / DWH) для последующего потребления смежными командами; — Разрабатывать и оптимизировать витрины данных для BI-отчетности в Superset и PowerBI; — Проводить глубокую проверку качества данных (Data Quality), выявлять аномалии и устранять корневые причины ошибок; — Обеспечивать бесперебойную актуальность данных, нести ответственность за соблюдение SLA и быстрое восстановление при авариях. Требования: — Опыт в направлении финтех; — Отличное знание SQL (DDL/DML) в PostgreSQL; — Хорошее знание SQL (DDL/DML) в ClickHouse; — Отличные навыки оптимизации SQL-запросов в PostgreSQL; — Отличные навыки работы с Python: написание и поддержка DAG-ов в Airflow, опыт работы с асинхронными сервисами; — Хорошие навыки конфигурирования PostgreSQL.
Зарплата не указана
- 4+ лет коммерческого опыта в роли Data Engineer / ETL-разработчик. - Сильный SQL.
Зарплата не указана
Требуется Data engineer. Требуемые навыки: — senior — Python.
280 000 – 300 000 ₽
Зарплата не указана
Quantori разрабатывает программное обеспечение для биотехнологических и фармацевтических компаний. Среди клиентов компании Pfizer, LGC, The Jackson Laboratory. В компании работает более 500 человек, инвестиции составляют 15 миллионов долларов. Требования: — Опыт работы не менее 6 лет — Знание Python, R, SQL, Spark, dbt — Уровень английского языка не ниже B2 Формат работы: удалённо.
Зарплата не указана
Задачи: — Развитие личного кабинета AI-тренеров: сбор данных из разных источников, настройка систем контроля качества, расчет качества и производительности, отображение данных на дашбордах, настройка пайплайнов поставки данных, написание YQL-скриптов и кода на Python, построение дашбордов в DataLens. — Инфраструктурные задачи: создание сред для обучения агентов, написание кода, развёртывание серверов и докер-образов с открытым кодом. — Контроль ресурсов аналитиков: выдача вычислительных ресурсов, мониторинг использования и оптимизация распределения. — Разработка инфраструктуры бенчмарков: помощь аналитикам в ускорении и упрощении создания бенчмарков для различных сценариев, работа на Python. Требования: — Умение писать на Python и SQL. — Любовь к работе с данными. Будет плюсом: — Опыт построения ETL-процессов, в том числе с Airflow. — Опыт работы с BI-системами (DataLens, Tableau, Power BI и др.). — Опыт работы с YTsaurus или аналогами. — Настройка CI/CD. Условия: — Бесплатное участие сотрудников Яндекса в профильных конференциях. — Школа подготовки спикеров для выступающих на конференциях. — Другие бонусы, полный список доступен на сайте компании.
Зарплата не указана
Задачи: - Сбор требований с бизнес-заказчиков и анализ источников данных - Разработка, реализация и поддержка типовых потоковых интеграционных решений на стеке технологий: Trino, Iceberg, S3, Spark, Apache Airflow, Kafka, Cosmos, Flink - Оперативное реагирование на информацию о проблемах в зоне ответственности, выполнение типовых задач в установленный срок - Поддержание в актуальном состоянии документации типовых интеграционных решений платформы больших данных, предоставление отчетности руководителю Требования: - Общее представление о стеке технологий Lakehouse - Понимание различия работы между BigData/Lakehouse и с данными обычного размера - Знание SQL (индексы, функции, оптимизация, профилирование производительности) - Опыт работы с любой реляционной БД (Oracle, Postgres, MySQL, MsSQL, DB2 и т.п.) - Умение работать с Git (знание команд git pull/commit/push) - Опыт работы с DBT, Cosmos - Представление о работе с Trino - Понимание устройства Iceberg, форматов данных - Понимание работы с minio или любого другого хранилища на основе S3 - Опыт использования систем ведения проектов и документации - Знания основ программирования (JAVA, Python)
Зарплата не указана
Задачи: – проектирование и разработка слоев данных (Raw, Clean, Enriched/Presentation) с учетом лучших практик моделирования (Data Vault 2.0 / 3NF для хранилища, Star Schema для витрин); – разработка и внедрение кастомных алгоритмов дедупликации и Entity Resolution (Fuzzy Matching) на Python; – формализация бизнес-правил качества данных в код, настройка уровней доверия к источникам и правил выживания (survivorship rules); – внедрение Data Contracts и механизмов карантина (quarantine) для некачественных данных с возможностью их последующего разбора; – настройка автоматизированного тестирования данных (Data Quality checks) в пайплайнах. Требования: – Продвинутый уровень SQL и опыт работы с dbt (или аналогами) для построения слоев данных; – уверенное владение PySpark и/или pandas для обработки больших объемов данных и реализации логики матчинга; – практический опыт применения библиотек нечёткого поиска и связывания записей (Splink, recordlinkage, dedupe, theFuzz); – понимание принципов работы алгоритмов сравнения строк (Левенштейн, Джаро-Винклер, косинусное сходство на TF-IDF/эмбеддингах); – глубокое понимание 2-3NF, Data Vault 2.0 и различий между слоями сырых, очищенных и обогащенных данных; – опыт внедрения инструментов тестирования данных (Great Expectations, Soda, dbt tests, deequ или аналоги); – опыт работы с оркестраторами (Airflow, Dagster или Prefect), уверенное использование Git и базовые навыки CI/CD для дата-пайплайнов.
Зарплата не указана
Требования: - Опыт TeamLead (управление командой) не менее 4 лет; - Опыт разработки ETL/ELT-процессов, в которых значительная часть логики реализована на стороне СУБД; - Опыт разработки и сопровождения хранимых процедур / функций в СУБД; - Практический опыт использования SQL/PLSQL или аналогичных процедурных расширений SQL для реализации загрузок и трансформаций данных; - Опыт участия в проектах миграции ETL-систем (Apache стек); - Опыт разработки на Python (написание ETL-скриптов, работа с pandas, интеграция с API); - Опыт написания и отладки DAG'ов в Apache Airflow (не только проектирование, но и разработка); - Опыт работы с PySpark (трансформации, оптимизация, партиционирование); - Опыт миграции ETL-процессов с Informatica PowerCenter на открытый стек (Airflow + Greenplum); - Глубокое практическое знание NiFi и Airflow: проектирование потоков, подключение источников, обработка ошибок, мониторинг, отладка; - Опыт работы с качеством данных: разработка правил валидации, анализ влияния на бизнес-процессы; - Понимание архитектурных подходов к проектированию хранилищ, различие ETL и ELT; - Опыт работы с Hive metastore (устройство, хранение на PostgreSQL) и форматами файлов (Parquet, ORC); - Опыт работы с Оracle; - Опыт применения сложных SQL-запросов (оконные функции, джоины); - Умение оптимизировать запросы для highload-среды; - Опыт проектирования интеграций Apache-стека с Kafka и BI-системами; - Опыт настройки потоковой обработки данных; - Опыт работы с Hadoop и Hive (знание версий, источников данных); - Опыт работы с PostgreSQL, Greenplum, Clickhouse; - Опыт работы с Grafana/Prometheus для отслеживания ETL-процессов; - Опыт работы с биллингом; - Опыт автоматической валидации и контроля качества данных после миграции (сравнение результатов, метрики); Обязанности: - Миграция ETL-процессов с Informatica PowerCenter на целевой стек: NiFi + Airflow + Greenplum + SQL/хранимые процедуры. - Подготовка документации AS IS и TO BE; - Написание SQL кода; - Отслеживание метрик.
280 000 – 300 000 ₽
Проект: Телекоммуникации Занятость: полная Локация: РФ Гражданство: РФ Формат: Удаленно Роль: Data Engineer (ETL-миграция) Локация: РФ, удаленно График: МСК ± 2 Гражданство: РФ Обязательно: - Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек); - Глубокий SQL: оконные функции, сложные джойны, иерархические запросы; - Оптимизация SQL для highload (партиционирование, индексы, explain plans); - Oracle (PL/SQL) и PostgreSQL; - Greenplum и/или Clickhouse; - Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow; - Hadoop (HDFS) и Hive; - Мониторинг ETL: Grafana/Prometheus или Victoria Metrics; - Опыт работы с биллинговыми системами (телеком-домен). Желательно: - Потоковая обработка: Kafka Streams / Spark Streaming; - Informatica PowerCenter (понимание мигрируемой системы); - Бинарные форматы хранения в Hadoop; - Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL; - Patroni для кластеризации PostgreSQL/Greenplum; - S3-хранилища; - КриптоПро или защищенные каналы передачи данных. Задачи: - Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum); - Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код; - Написание и оптимизация SQL для витрин данных и ETL-процессов; - Разработка DAG-ов в Airflow; - Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы); - Разработка Spark-джобов (PySpark) для больших объемов; - Интеграция с Kafka для потоковой передачи; - Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик; - Разбор инцидентов по качеству данных и ошибкам загрузки; - Code review. Ключевые компетенции для отбора: миграция ETL-систем, SQL (оконные функции, оптимизация), Oracle PL/SQL, PostgreSQL, Greenplum, Clickhouse, Apache Spark (PySpark), NiFi, Airflow, Kafka, Hadoop, Hive, Grafana/Prometheus, биллинг, телеком.
Зарплата не указана
Задачи: - Проводить проектную коммуникацию с представителями бизнес-заказчика с целью уточнения бизнес-требований - Выявлять и проводить анализ бизнес-требований, потребностей и проблем бизнес-заказчика - Формировать спецификации требований, описание логических моделей, структур данных и проектных решений (хранилища и витрины данных) - Согласовывать проектные решения с архитекторами, разработчиками и аналитиками смежных команд - Проектировать и разрабатывать ETL/ELT процессы, слои хранилища и витрины данных - Разрабатывать и оптимизировать SQL-запросы - Проводить внутреннее тестирование и контроль качества информационных продуктов, реализованных разработчиками - Принимать участие в приёмочных испытаниях информационных продуктов и документации с заказчиками - Обеспечивать контроль качества данных и их целостность Требования: - Высшее образование: техническое, математическое или финансовое - Опыт работы не менее 5 лет - Уверенные знания Python, GIT, Airflow (DAG с декомпозицией задач, зависимостями, сенсорами) - Глубокое знание SQL: оконные функции, процедуры, функции, вложенные запросы, опыт оптимизации запросов - Понимание индексов, партиций, ключей, нормальных форм, SCD - Понимание моделирования данных, построения хранилища, репликации и консистентности данных - Умение рефакторить код и проводить миграцию из одной системы в другую - Знание принципов CI/CD - Знание PL/SQL для Oracle, Postgres, Greenplum или знание иной MPP СУБД (будет плюсом) - Опыт работы с API (будет плюсом) - Знание ООП, DBT, Kafka, Bash, SAS (будет плюсом)
Зарплата не указана
Задачи: — Строить и развивать аналитическое хранилище компании на базе BigQuery. — Настраивать конвейеры данных из продуктовых и маркетинговых источников (AppsFlyer, Adjust, RevenueCat, Amplitude, Mixpanel, Facebook Ads и др.). — Формировать данные в удобный для аналитиков и продуктовых менеджеров вид. — Документировать модель данных. — Внедрять лучшие практики работы с хранилищем: слоистая архитектура (raw / staging / marts), соглашения по наименованиям, версионирование, тесты качества данных. — Взаимодействовать с продуктом, маркетингом и аналитикой для понимания бизнес-требований и трансформации их в структуру данных. Требования: — Опыт работы в data engineering от 2 лет или сильная аналитическая роль с реальным инженерным компонентом (уровень solid junior / light middle). — Уверенное владение Python для написания ETL/ELT скриптов, работы с API и автоматизации конвейеров. — Опыт работы с GCP (BigQuery, Cloud Functions, Cloud Storage). — Уверенный уровень SQL: оконные функции, CTE, оптимизация запросов. — Понимание принципов аналитических хранилищ: слоистая архитектура, нормализация/денормализация, идемпотентность конвейеров, инкрементальные загрузки. — Опыт интеграции данных из внешних источников через API или готовые коннекторы. — Сильные коммуникативные навыки для общения с нетехническими стейкхолдерами, умение задавать уточняющие вопросы и объяснять технические ограничения простым языком. — Опыт работы с Git: ветвление, код-ревью. Желательно: — Опыт с типичными источниками подписочного/мобильного стека: AppsFlyer, Adjust, Adapty, Amplitude, Mixpanel. — Понимание специфики мобильной атрибуции: SKAdNetwork, постбеки, детерминистическая и вероятностная атрибуция. — Опыт работы с BI-инструментами (Looker Studio, Metabase, Tableau, Power BI) на уровне настройки источника и построения дашбордов. — Знания Terraform / IaC для ресурсов GCP. — Опыт с CDC / стримингом (Pub/Sub, Dataflow) — плюс, но не критично. Условия: — Гибридный формат работы: 2 дня в офисе в Варшаве, 3 дня удаленно. — Обеды оплачиваются в офисные дни. — Возможность участвовать в командных мероприятиях. — Гибкий график с фокусом на результат. — Работа в молодой команде с энергией стартапа, без бюрократии и микроменеджмента.
Зарплата не указана
Требования: - sql, базы данных, python, аналитический склад ума Обязанности: - построение ETL-процессов - работа с современным стеком трансформации - оркестрация данных - управление хранилищами - визуализация смыслов - оптимизация выборок Условия: Срочный трудовой договор на 3 месяца, удаленно/офис/гибрид. Стажировка для студентов из любых ВУЗов.
Зарплата не указана