Задачи:
– Развивать платформу данных;
– Разрабатывать и оптимизировать ETL/ELT-процессы;
– Работать с batch- и streaming-пайплайнами;
– Развивать модели данных и хранилище;
– Повышать производительность и надежность платформы;
– Настраивать мониторинг, алертинг и контроль качества данных;
– Автоматизировать эксплуатационные процессы;
– Участвовать в технических ревью и развитии инженерных практик команды.
Требования:
– Уверенное владение Python и SQL;
– Опыт работы с Spark, Clickhouse, Hadoop, Kafka, Greenplum, S3 (Ceph, Minio);
– Опыт написания DAG-ов для Airflow;
– Опыт работы с Docker и K8S;
– Навыки работы с Linux;
– Навыки работы с Git.
Задачи:
— Развивать платформу данных;
— Разрабатывать и оптимизировать ETL/ELT-процессы;
— Работать с batch- и streaming-пайплайнами;
— Развивать модели данных и хранилище.
Задачи:
— Погружение в сложные системы и ручные рабочие процессы для понимания инструментов и ограничений.
— Проектирование и поддержка чистых, масштабируемых, производственных моделей dbt (например, ARR, признание доходов).
— Работа с полным циклом обработки данных: от загрузки до трансформации и визуализации.
— Практический подход к системным задачам, балансируя быстрые решения и продуманную долгосрочную архитектуру.
— Сотрудничество с командами финансов, инженерии, продаж и другими для понимания потребностей в данных и своевременной реализации решений.
Требования:
— Опыт проектирования и поддержки производственных моделей данных и конвейеров.
— Глубокое понимание современных принципов и лучших практик моделирования данных.
— Сильные навыки SQL и уверенность в работе со сложными наборами данных и схемами.
— Внимание к деталям и высокие стандарты точности и валидации данных.
— Гибкость и находчивость при работе с ручными задачами или несовершенными системами.
— Страсть к чистому коду, масштабируемой архитектуре и постепенному снижению сложности.
— Умение эффективно управлять временем и приоритетами в быстро меняющейся среде.
— Четкие коммуникативные навыки для взаимодействия с техническими и нетехническими коллегами.
— Готовность поддерживать другие области (например, продукт, маркетинг, инженерия) по мере роста команды.
Преимущества:
— Опыт работы в быстрорастущей PLG SaaS компании.
— Успешный опыт трансформации ручных, разовых рабочих процессов в масштабируемые конвейеры данных.
— Знакомство с биллинговыми системами, GAAP бухгалтерией, признанием доходов или поддержкой аудита.
— Опыт работы с Stripe, Salesforce или Orb в контексте финансов и биллинга.
— Знание финансовых циклов и необходимости быстрой итерации в конце месяца и квартала.
Условия:
— Полностью удаленная работа (компания remote-first).
— Конкурентный пакет компенсации, включающий базовую зарплату, акции и комплексные льготы.
— Гибкая и инклюзивная рабочая среда.
— Оплачиваемый отпуск и поддержка баланса работы и жизни.
— Финансирование профессионального развития до $1500 в год, менторство и возможности внутреннего роста.
— Оплачиваемый отпуск по уходу за ребенком (20 недель для рожающих родителей, 16 недель для не рожающих).
— Корпоративные программы для работы из дома, включая выбор ноутбука, компенсацию интернета и бюджет на обустройство рабочего места.
— Взносы работодателя в пенсионный фонд с матчингом до 0.75% от заработка.
— Возможность участия в ежегодных корпоративных мероприятиях и командных выездах.
Технологический стек:
Snowflake, dbt, Hightouch, Fivetran, Looker, Stripe, Salesforce, Orb.
Удалённо
203 680 – 254 600 $
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Компания TWINBY разрабатывает современное мобильное приложение для знакомств, которое соединяет пользователей, ориентируясь не на внешность или случайные фотографии, а на их психологическую совместимость. Вакансия предполагает удалённую работу в роли Data Engineer, где специалист будет заниматься обработкой и анализом данных, необходимым для функционирования сервиса.
– Разработка, создание и поддержка надежных конвейеров обработки данных и процессов ETL/ELT для поддержки различных источников данных, включая структурированные и неструктурированные данные, с обеспечением высокого качества и целостности данных. Хороший опыт работы с Databricks.
Требования:
— Опыт миграции ETL-систем (желательно с Oracle/Informatica на Apache стек)
— Глубокий SQL: оконные функции, сложные джойны, иерархические запросы
— Оптимизация SQL для highload (партиционирование, индексы, explain plans)
— Oracle (PL/SQL) и PostgreSQL
— Greenplum и/или Clickhouse
— Проектирование архитектур на Apache Spark (PySpark), NiFi, Airflow
— Hadoop (HDFS) и Hive
— Мониторинг ETL: Grafana/Prometheus или Victoria Metrics
— Опыт работы с биллинговыми системами (желательно телеком-домен)
Преимущества:
— Потоковая обработка: Kafka Streams / Spark Streaming
— Informatica PowerCenter (понимание мигрируемой системы)
— Бинарные форматы хранения в Hadoop
— Различия: Hive vs Impala, Greenplum vs PostgreSQL, Clickhouse vs PostgreSQL
— Patroni для кластеризации PostgreSQL/Greenplum
— S3-хранилища
— КриптоПро или защищенные каналы передачи данных
Задачи:
— Миграция ETL-системы телеком-оператора с Oracle/Informatica на Apache стек (S3, Airflow, NiFi, Kafka, Greenplum)
— Перенос бизнес-логики из Informatica в высокопроизводительный SQL-код
— Написание и оптимизация SQL для витрин данных и ETL-процессов
— Разработка DAG-ов в Airflow
— Настройка пайплайнов в NiFi (источники: Oracle, PostgreSQL; приемники: S3, файловые архивы)
— Разработка Spark-джобов (PySpark) для больших объемов
— Интеграция с Kafka для потоковой передачи
— Настройка мониторинга (Grafana/Prometheus) и отслеживание метрик
— Разбор инцидентов по качеству данных и ошибкам загрузки
— Code review
Ищем сильного Data-инженера для прототипирования корпоративных AI-ассистентов. Это роль на стыке классического DE и AI: нужно не просто строить пайплайны, но и готовить контекст для LLM, оценивать качество RAG и бороться с галлюцинациями.
-Design, build, and maintain data infrastructure and pipelines spanning both batch and real-time / streaming workloads, contributing to architectural decisions along the way. -Build and maintain scalable, efficient, and reliable ETL/ELT pipelines using languages and frameworks such as Python, SQL, Spark, Flink, Beam, or equivalents.
– выполнять задачи полного жизненного цикла: от сбора требований до выкатки на установку в прод; – разрабатывать и дорабатывать витрины и решения, автоматизировать их через оркестраторы;
– Развивать корпоративную платформу данных и DWH; – Переводить существующие ETL-процессы с SSIS на Apache Airflow 3 и внутренний YAML-driven Python-фреймворк;
Задачи:
– Разрабатывать и дорабатывать ETL-процессы в Airflow
– Подключать новые источники данных
– Создавать и дорабатывать витрины
– Оптимизировать SQL-запросы в GreenPlum и PostgreSQL
– Работать с большими объемами данных
– Развивать процессы контроля качества данных
Требования:
– От 1 года опыта работы с данными
– Отличное знание SQL: JOIN, оконные функции, процедуры
– Умение профилировать и оптимизировать запросы, понимать план выполнения
– Понимание принципов работы реляционных БД и архитектуры DWH: ODS, DDS, DM
– Практический опыт работы с Airflow и ETL-процессами
– Python на базовом уровне
– Знание Linux и умение работать с командной строкой
– Опыт работы с Git
– Понимание принципов работы Docker
Quantori разрабатывает программное обеспечение для биотехнологических и фармацевтических компаний. Среди клиентов компании Pfizer, LGC, The Jackson Laboratory. В компании работает более 500 человек, инвестиции составляют 15 миллионов долларов.
Требования:
— Опыт работы не менее 6 лет
— Знание Python, R, SQL, Spark, dbt
— Уровень английского языка не ниже B2
Формат работы: удалённо.
Задачи:
– проектирование и разработка слоев данных (Raw, Clean, Enriched/Presentation) с учетом лучших практик моделирования (Data Vault 2.0 / 3NF для хранилища, Star Schema для витрин);
– разработка и внедрение кастомных алгоритмов дедупликации и Entity Resolution (Fuzzy Matching) на Python;
– формализация бизнес-правил качества данных в код, настройка уровней доверия к источникам и правил выживания (survivorship rules);
– внедрение Data Contracts и механизмов карантина (quarantine) для некачественных данных с возможностью их последующего разбора;
– настройка автоматизированного тестирования данных (Data Quality checks) в пайплайнах.
Требования:
– Продвинутый уровень SQL и опыт работы с dbt (или аналогами) для построения слоев данных;
– уверенное владение PySpark и/или pandas для обработки больших объемов данных и реализации логики матчинга;
– практический опыт применения библиотек нечёткого поиска и связывания записей (Splink, recordlinkage, dedupe, theFuzz);
– понимание принципов работы алгоритмов сравнения строк (Левенштейн, Джаро-Винклер, косинусное сходство на TF-IDF/эмбеддингах);
– глубокое понимание 2-3NF, Data Vault 2.0 и различий между слоями сырых, очищенных и обогащенных данных;
– опыт внедрения инструментов тестирования данных (Great Expectations, Soda, dbt tests, deequ или аналоги);
– опыт работы с оркестраторами (Airflow, Dagster или Prefect), уверенное использование Git и базовые навыки CI/CD для дата-пайплайнов.
Требования:
- Опыт TeamLead (управление командой) не менее 4 лет;
- Опыт разработки ETL/ELT-процессов, в которых значительная часть логики реализована на стороне СУБД;
- Опыт разработки и сопровождения хранимых процедур / функций в СУБД;
- Практический опыт использования SQL/PLSQL или аналогичных процедурных расширений SQL для реализации загрузок и трансформаций данных;
- Опыт участия в проектах миграции ETL-систем (Apache стек);
- Опыт разработки на Python (написание ETL-скриптов, работа с pandas, интеграция с API);
- Опыт написания и отладки DAG'ов в Apache Airflow (не только проектирование, но и разработка);
- Опыт работы с PySpark (трансформации, оптимизация, партиционирование);
- Опыт миграции ETL-процессов с Informatica PowerCenter на открытый стек (Airflow + Greenplum);
- Глубокое практическое знание NiFi и Airflow: проектирование потоков, подключение источников, обработка ошибок, мониторинг, отладка;
- Опыт работы с качеством данных: разработка правил валидации, анализ влияния на бизнес-процессы;
- Понимание архитектурных подходов к проектированию хранилищ, различие ETL и ELT;
- Опыт работы с Hive metastore (устройство, хранение на PostgreSQL) и форматами файлов (Parquet, ORC);
- Опыт работы с Оracle;
- Опыт применения сложных SQL-запросов (оконные функции, джоины);
- Умение оптимизировать запросы для highload-среды;
- Опыт проектирования интеграций Apache-стека с Kafka и BI-системами;
- Опыт настройки потоковой обработки данных;
- Опыт работы с Hadoop и Hive (знание версий, источников данных);
- Опыт работы с PostgreSQL, Greenplum, Clickhouse;
- Опыт работы с Grafana/Prometheus для отслеживания ETL-процессов;
- Опыт работы с биллингом;
- Опыт автоматической валидации и контроля качества данных после миграции (сравнение результатов, метрики);
Обязанности:
- Миграция ETL-процессов с Informatica PowerCenter на целевой стек: NiFi + Airflow + Greenplum + SQL/хранимые процедуры.
- Подготовка документации AS IS и TO BE;
- Написание SQL кода;
- Отслеживание метрик.