Требования:
- Опыт TeamLead (управление командой) не менее 4 лет;
- Опыт разработки ETL/ELT-процессов, в которых значительная часть логики реализована на стороне СУБД;
- Опыт разработки и сопровождения хранимых процедур / функций в СУБД;
- Практический опыт использования SQL/PLSQL или аналогичных процедурных расширений SQL для реализации загрузок и трансформаций данных;
- Опыт участия в проектах миграции ETL-систем (Apache стек);
- Опыт разработки на Python (написание ETL-скриптов, работа с pandas, интеграция с API);
- Опыт написания и отладки DAG'ов в Apache Airflow (не только проектирование, но и разработка);
- Опыт работы с PySpark (трансформации, оптимизация, партиционирование);
- Опыт миграции ETL-процессов с Informatica PowerCenter на открытый стек (Airflow + Greenplum);
- Глубокое практическое знание NiFi и Airflow: проектирование потоков, подключение источников, обработка ошибок, мониторинг, отладка;
- Опыт работы с качеством данных: разработка правил валидации, анализ влияния на бизнес-процессы;
- Понимание архитектурных подходов к проектированию хранилищ, различие ETL и ELT;
- Опыт работы с Hive metastore (устройство, хранение на PostgreSQL) и форматами файлов (Parquet, ORC);
- Опыт работы с Оracle;
- Опыт применения сложных SQL-запросов (оконные функции, джоины);
- Умение оптимизировать запросы для highload-среды;
- Опыт проектирования интеграций Apache-стека с Kafka и BI-системами;
- Опыт настройки потоковой обработки данных;
- Опыт работы с Hadoop и Hive (знание версий, источников данных);
- Опыт работы с PostgreSQL, Greenplum, Clickhouse;
- Опыт работы с Grafana/Prometheus для отслеживания ETL-процессов;
- Опыт работы с биллингом;
- Опыт автоматической валидации и контроля качества данных после миграции (сравнение результатов, метрики);
Обязанности:
- Миграция ETL-процессов с Informatica PowerCenter на целевой стек: NiFi + Airflow + Greenplum + SQL/хранимые процедуры.
- Подготовка документации AS IS и TO BE;
- Написание SQL кода;
- Отслеживание метрик.
Задачи:
- Проводить проектную коммуникацию с представителями бизнес-заказчика с целью уточнения бизнес-требований
- Выявлять и проводить анализ бизнес-требований, потребностей и проблем бизнес-заказчика
- Формировать спецификации требований, описание логических моделей, структур данных и проектных решений (хранилища и витрины данных)
- Согласовывать проектные решения с архитекторами, разработчиками и аналитиками смежных команд
- Проектировать и разрабатывать ETL/ELT процессы, слои хранилища и витрины данных
- Разрабатывать и оптимизировать SQL-запросы
- Проводить внутреннее тестирование и контроль качества информационных продуктов, реализованных разработчиками
- Принимать участие в приёмочных испытаниях информационных продуктов и документации с заказчиками
- Обеспечивать контроль качества данных и их целостность
Требования:
- Высшее образование: техническое, математическое или финансовое
- Опыт работы не менее 5 лет
- Уверенные знания Python, GIT, Airflow (DAG с декомпозицией задач, зависимостями, сенсорами)
- Глубокое знание SQL: оконные функции, процедуры, функции, вложенные запросы, опыт оптимизации запросов
- Понимание индексов, партиций, ключей, нормальных форм, SCD
- Понимание моделирования данных, построения хранилища, репликации и консистентности данных
- Умение рефакторить код и проводить миграцию из одной системы в другую
- Знание принципов CI/CD
- Знание PL/SQL для Oracle, Postgres, Greenplum или знание иной MPP СУБД (будет плюсом)
- Опыт работы с API (будет плюсом)
- Знание ООП, DBT, Kafka, Bash, SAS (будет плюсом)
УдалённоseniorМосква
Зарплата не указана
Не хотите искать каждый день?
Настройте подбор один раз, и подходящие вакансии будут сами приходить в Telegram.
Требования:
- sql, базы данных, python, аналитический склад ума
Обязанности:
- построение ETL-процессов
- работа с современным стеком трансформации
- оркестрация данных
- управление хранилищами
- визуализация смыслов
- оптимизация выборок
Условия:
Срочный трудовой договор на 3 месяца, удаленно/офис/гибрид.
Стажировка для студентов из любых ВУЗов.
Задачи:
– Разработка и оптимизация ETL-процессов с использованием Python и SQL.
– Разработка и внедрение масштабируемых конвейеров обработки данных для обработки различных источников данных.
– Работа с реляционными базами данных (например, PostgreSQL, Oracle) для обеспечения эффективного хранения и извлечения данных.
– Оптимизация SQL-запросов и скриптов Python для повышения производительности и удобства сопровождения.
– Внедрение надежной обработки ошибок, ведение журналов и мониторинг для конвейеров обработки данных.
– Взаимодействие с межфункциональными командами для интеграции и управления источниками данных.
Требования:
– Более 5 лет опыта в области проектирования данных.
– Навыки работы с Python и SQL на экспертном уровне – умение писать эффективный, масштабируемый и поддерживаемый код.
– Обширный опыт в проектировании ETL-процессов и работе с большими массивами данных.
– Глубокое понимание оптимизации производительности баз данных и оптимизации запросов.
– Опыт работы с моделированием данных и проектированием схем.
– Знание решений для облачного хранения данных (Azure, AWS или GCP).
– Высокие навыки решения проблем и способность работать самостоятельно.
– Желательно: опыт работы с PySpark, оркестраторами и знание CI/CD для автоматизации процесса развертывания.
Условия:
– Полностью удаленная позиция с гибкими условиями работы.
Требования к кандидату:
- 6+ years commercial Data Engineering
- Enterprise-scale data pipelines & platforms
- Microsoft Azure data services
- Azure Databricks + Apache Spark
- Azure Data Factory
- Microsoft Fabric + modern cloud analytics
- Azure Data Lake (ADLS) or equivalent
- Strong SQL + ETL/ELT
- Medallion architecture + reusable frameworks
- CI/CD & DevOps (Azure DevOps preferred)
Компания Tabby ищет опытного инженера данных для работы в команде Data Services. В обязанности входит разработка внутренних решений, включая Feature Store, а также выполнение операционных задач. Ключевые задачи включают создание хранилищ данных и других сервисов обработки, разработку конвейеров EL/ELT/ETL, а также интеграцию новых инструментов для обработки и хранения данных. Требуется опыт от 3 до 5 лет в роли инженера данных, инженера машинного обучения или бэкенд-инженера, умение создавать высокопроизводительные и масштабируемые системы обработки и хранения данных, а также знание систем управления событиями и потоковых конвейеров. Необходимы навыки программирования на Python с применением лучших практик, владение SQL и его эффективным использованием, а также понимание современных методов проектирования систем. Технологический стек включает Airflow, Debezium, BigQuery или Clickhouse, PostgreSQL или CockroachDB, Docker, GitLab (CI/CD), GCP. Также важен опыт работы с REST API, GRPC API, брокерами сообщений и очередями.
About LawnStarter
LawnStarter is the nation's leading on-demand marketplace for lawn care and outdoor services, with over $100M in annual bookings. The company is expanding beyond lawn care to become a one-stop shop for all home services, operating across three brands (LawnStarter, Lawn Love, Home Gnome) on a single shared platform.
About Analytics at LawnStarter
The analytics team supports the entire company including product, marketing, operations, and finance. The data platform includes a centralized Redshift data warehouse, modeled in dbt and orchestrated by Airflow, with Segment feeding event data. The team is mid-migration to Lightdash as the single BI platform, replacing Tableau and Metabase. Currently, data quality, tracking standards, and platform hygiene are side tasks handled by analysts.
The Role
The Analytics Engineering Manager will be the first dedicated person for data governance, responsible for data trustworthiness and the roadmap to improve it quarterly. Responsibilities include ensuring quality and freshness of source data, pipelines, reports, metric definitions, Segment event tracking standards, Lightdash workspace health, data feeding ML models, and data security. The role involves collaborating with product, marketing, ops, and finance to prioritize platform work. It is a hands-on role starting solo, building automation, checks, fixing issues, and establishing scalable processes. Eventually, the manager will hire a Lead Analytics Engineer and grow the function as needed.
Key differentiators of the role:
- First dedicated governance role, reshaping existing standards.
- Owns the data roadmap, discovering business needs and prioritizing work.
- Whole-stack ownership from source data to ML models.
- Leading the migration to Lightdash, setting up permissions and norms.
Responsibilities:
- Develop and manage the data roadmap balancing business needs and platform health.
- Automate monitoring of data quality and freshness, resolve incidents.
- Maintain data lineage and impact analysis to assess downstream effects of changes.
- Administer Lightdash workspace, permissions, and rollout.
- Extend and guard the semantic layer with governed metric definitions.
- Govern Segment event tracking catalog, standards, and drift detection.
- Ensure AI data readiness for internal AI tools querying the warehouse.
- Manage data security, privacy, access controls, and compliance with US state laws.
- Maintain governance documentation, ownership models, and review processes.
Challenges to solve:
- Convert business requests into a prioritized data roadmap.
- Ensure Lightdash migration improves platform usability without dashboard sprawl.
- Complete and maintain a trustworthy semantic layer.
- Manage event-tracking standards and prevent entropy.
- Proactively detect and prevent data pipeline breakages with automation and lineage.
Success metrics for year 1:
- Zero pipeline incidents from unannounced data changes.
- Zero freshness incidents; stakeholders never see stale dashboards.
- All business areas use official, well-maintained metrics and dashboards.
- Every Segment event has an owner and meets standards.
- Governance operates as a documented, sustainable system.
Requirements:
- Passion for data governance as a craft.
- Daily use of AI tools for automation, anomaly triage, and documentation.
- Hands-on manager who codes, debugs, and configures personally.
- Product-minded, able to translate vague requests into prioritized plans.
- Automation-first approach to quality checks.
- Ability to enforce standards with clear rules and good tooling.
Role exclusions:
- Not a large-team leadership role; starts solo with potential to hire one lead.
- Not a policy or committee role; hands-on fixing with code and conversations.
- Not a BI analyst role; focuses on platform and guardrails, not dashboard building.
- Not a mature system babysitting role; involves building and evolving the platform.
Technologies involved:
- Warehouse & pipelines: Redshift, dbt, Airflow
- Ingestion: Fivetran, custom Airflow pipelines
- Event tracking: Segment
- BI tools: Lightdash (primary), Tableau and Metabase (sunsetting)
- AI tooling: Claude Code, Codex, Brain (internal AI toolkit)
- Observability: AI-powered Analytics Engineer agent for monitoring and anomaly detection
Benefits:
- Base salary $75k-$120k/year
- Fully remote with asynchronous collaboration
- Flexible PTO
Equal employment opportunity statement included.
Задачи:
— Владение дорожной картой данных: выявление потребностей продукта, маркетинга, операций и финансов в данных, приоритизация задач с учетом состояния платформы и последовательное планирование инвестиций.
— Обеспечение качества и актуальности данных: автоматический мониторинг источников данных, конвейеров и отчетов, выявление изменений в схемах и источниках до возникновения проблем, управление инцидентами.
— Анализ происхождения данных и влияния изменений: создание живой карты от источника до отчетов, оценка влияния изменений на downstream компоненты до их внедрения, внедрение контрактов данных с инженерией.
— Администрирование Lightdash: настройка структуры рабочего пространства, прав доступа, обучение пользователей, поддержание порядка и производительности.
— Управление семантическим слоем: расширение и поддержка единого определения метрик, предотвращение неконтролируемого роста.
— Управление каталогом событий Segment: проверка новых событий на соответствие стандартам, поддержание соответствия с продакшеном, развитие правил и обнаружение отклонений.
— Обеспечение готовности данных для AI: контроль доступа AI-инструментов к данным, поддержание документации, консистентности и безопасности.
— Обеспечение безопасности и конфиденциальности данных: контроль доступа, обработка персональных данных в соответствии с законами штатов США, регулярные проверки.
— Поддержка системы управления: документация, модели владения и циклы обзора для устойчивой работы процессов.
Требования:
— Профессиональное отношение к управлению данными, стремление к поддержанию чистоты и надежности систем.
— Активное использование AI-инструментов для автоматизации проверок, обработки аномалий и документации.
— Практический опыт управления командой и самостоятельной работы с SQL, Airflow, настройкой прав доступа.
— Ориентация на продукт, умение превращать запросы бизнеса в приоритетный план.
— Стремление к автоматизации повторяющихся проверок.
— Умение устанавливать стандарты и добиваться их соблюдения с помощью инструментов и коммуникации.
Условия:
— Базовая зарплата $75,000-$120,000 в год.
— Полностью удаленная работа с асинхронным взаимодействием.
— Гибкий отпуск по результатам работы.
Описание роли:
— Первая позиция, посвященная управлению данными и их качеством в компании.
— Роль с полным владением цепочкой данных от источника до отчетов и моделей машинного обучения.
— Роль с практической деятельностью и последующим расширением команды.
— Не руководящая большая команда, а построение и развитие функции.
— Не роль BI-аналитика или политика, а инженерно-управленческая позиция.
Технологии:
— Хранилище и конвейеры: Redshift, dbt, Airflow.
— Интеграция данных: Fivetran, кастомные Airflow конвейеры.
— Отслеживание событий: Segment.
— BI-платформы: Lightdash (основная), Tableau и Metabase (выводятся).
— AI-инструменты: Claude Code, Codex, Brain (внутренний AI-инструмент).
— Наблюдение: AI-агент для мониторинга свежести, обнаружения аномалий и lineage dbt.
Nitka Technologies is an international IT company specializing in custom software development and IT consulting.
The position is for a Senior Data Engineer working with Delphix technology.
The work format is remote.
Задачи:
– Разработка и рефакторинг ETL/ELT пайплайнов на pyspark;
– Разработка и поддержка OLAP движков Starrocks/Clickhouse;
– Поддержка текущих пайплайнов на Greenplum и Hadoop;
– Миграция с HDFS на S3;
– Оптимизация spark-приложений.
Требования:
– Опыт работы с Python от 3 лет;
– Глубокое знание SQL и опыт работы с большими данными;
– Опыт работы с Apache Airflow;
– Опыт проектирования и разработки ETL/ELT процессов;
– Опыт работы с колоночными БД (ClickHouse);
– Знание принципов построения Data Warehouse и Data Lake;
– Понимание разницы между OLTP/OLAP системами;
– Уверенная работа c linux и git;
– Понимание процессов ci/cd.
Задачи:
– Разработка, создание и поддержка масштабируемых конвейеров обработки данных с использованием Apache Spark и современных платформ обработки данных.
– Разработка и оптимизация архитектур хранилищ данных для поддержки рабочих процессов анализа данных и машинного обучения.
– Внедрение моделей и структур данных, обеспечивающих качество, согласованность и доступность данных.
– Сотрудничество со специалистами по анализу данных и аналитиками для понимания потребностей в данных и предложения решений.
– Обеспечение безопасности данных и соответствия нормативным требованиям.
– Мониторинг и устранение неполадок, связанных с производительностью и надежностью конвейера обработки данных.
– Постоянное совершенствование процессов и передовых методов обработки данных.
– Взаимодействие с межфункциональными командами и участие в технических дискуссиях.
– На руководящей должности оказание технической поддержки и наставничество младших инженеров.
Требования:
– Опыт работы с Python или Scala/Java.
– Углубленные знания SQL.
– Практический опыт работы с Apache Spark, Databricks, Snowflake или Microsoft Fabric.
– Понимание концепции и архитектуры хранилища данных (data lakehouse).
– Понимание основ распределенных систем.
– Навыки моделирования данных и создания хранилищ данных.
– Опыт работы с облачными архитектурами данных на платформах AWS, Azure или GCP.
– Готовность к обучению и экспериментам с разными решениями.
– Ценить баланс между работой и личной жизнью, избегать сверхурочной работы.
– Умение просить о помощи и работать в команде.
Задачи:
– Проектирование и развитие корпоративного хранилища данных (КХД)
– Разработка и оптимизация архитектуры DWH
– Проектирование, разработка и сопровождение ETL-процессов
– Построение витрин данных под бизнес-задачи
– Настройка, оптимизация и мониторинг загрузок данных
– Контроль и обеспечение качества данных
– Разработка SQL-скриптов, процедур и серверного кода
– Участие в проектах миграции и интеграции данных
– Интеграция источников через брокеры сообщений и REST API
– Подготовка технической документации
– Взаимодействие с командами аналитики и BI.
Требования:
– Высшее / неполное высшее образование
– Опыт работы Data Engineer / Архитектором DWH от 4 лет
– Опыт проектирования КХД от 1 года (Oracle, PostgreSQL)
– Понимание архитектуры и принципов построения DWH
– Опыт разработки ETL-процессов
– Опыт построения витрин данных
– Понимание принципов Data Quality
– Экспертное знание SQL (Oracle, PostgreSQL)
– Опыт миграции данных с использованием серверного кода
– Опыт настройки и оптимизации загрузок
– Опыт работы с Apache Kafka, RabbitMQ
– Python — обязательно
– Русский — свободно, английский — чтение/написание тех. документации.
Специалист с коммерческим качественным опытом 3+ лет, который не просто пишет код по указке, а понимает бизнес-логику данных, может самостоятельно довести задачу до production, готов решать разного рода задачи.
Задачи:
— Участвовать в проектировании и реализации высокопроизводительных, масштабируемых и оптимизированных дата-решений.
— Создавать модели данных с нуля, используя сильные навыки SQL.
— Писать и оптимизировать SQL-запросы внутри приложений.
— Обеспечивать производительность, безопасность и доступность баз данных.
— Готовить документацию и технические спецификации.
— Выполнять процедуры с базами данных: обновления, резервное копирование, восстановление и миграция.
— Профилировать использование ресурсов сервера и оптимизировать конфигурации.
— Проектировать, строить и автоматизировать развертывание дата-пайплайнов и приложений.
— Интегрировать данные из локальных баз и внешних источников через REST API и инструменты сбора данных.
— Сотрудничать с бизнес-подразделениями и командами дата-сайенс по вопросам доступа, трансформации, обработки и отчетности данных.
— Поддерживать внедрение, технические вопросы и обучение, связанные с экосистемой data lake.
— Управлять AWS-ресурсами, включая кластеры EMR и ECS.
— Поддерживать обеспечение, мониторинг, конфигурацию и обслуживание AWS-инструментов.
— Оценивать и внедрять новые облачные технологии для улучшения возможностей и снижения затрат.
— Поддерживать автоматизацию с использованием Infrastructure as Code (Terraform) и CI/CD (Jenkins).
— Реализовывать управление данными, контроль доступа и снижение рисков безопасности.
Требования:
— 7-9 лет опыта проектирования и разработки облачных моделей данных, ETL-пайплайнов и инфраструктуры.
— Опыт работы с структурированными и неструктурированными данными.
— Отличное владение SQL для популярных баз данных.
— Опыт оптимизации больших и сложных SQL-запросов.
— Знание лучших практик реляционных баз данных.
— Опыт настройки движков баз данных и оркестрации кластеров.
— Умение планировать ресурсы по высоким спецификациям.
— Навыки устранения типичных проблем с базами данных.
— Опыт работы со Spark, Glue, EMR, Apache Kafka или AWS Kinesis.
— Опыт с системами контроля версий Git или Subversion.
— Опыт использования автоматизированных систем сборки и CI/CD.
— Программирование на Java, Python и Scala.
— Знание структур данных и алгоритмов.
— Знание реляционных, NoSQL, графовых, документных, key-value и временных баз данных.
— Знание масштабируемого проектирования и управления моделями данных.
— Знание деплоя ML-моделей.
— Знание AWS cloud платформ.
— Знание TDD и BDD.
— Сильный интерес к улучшению навыков разработки ПО, фреймворков и технологий.
Условия:
— Возможность работать с моделированием данных, сервисами данных и дата-сайенсом в рамках платформы Data Intelligence.
— Работа в разнообразной технической среде: AWS, ETL-пайплайны, базы данных, поисковые технологии, рекомендательные системы.
— Прямое взаимодействие с командами дата-сайенс и внутренними заинтересованными сторонами по вопросам отчетности, трансформации и возможностей платформы.
Задачи:
— Проектировать и разрабатывать сквозные конвейеры данных с использованием Azure Data Factory, SQL и других сервисов Azure.
— Реализовывать сложные модели данных, меры DAX и вычисляемые столбцы для поддержки отчетности.
— Управлять и оптимизировать ETL-процессы, обеспечивая качество данных, согласованность и высокую производительность.
— Проектировать и поддерживать хранилища данных и размерные модели (например, схемы звезды/снежинки).
— Сотрудничать с аналитиками, разработчиками и заинтересованными сторонами для преобразования бизнес-требований в технические решения.
— Интегрировать данные из различных источников, включая SQL-базы данных, облачное хранилище, API и плоские файлы.
— Обеспечивать управление данными, точность и целостность в BI-экосистеме.
Требования:
— Опыт работы в роли Data Engineer не менее 5 лет.
— Продвинутые знания SQL: сложные запросы, оптимизация производительности, хранимые процедуры.
— Глубокое понимание технологий Azure: Azure SQL Database, Data Factory и др.
— Опыт разработки ETL, интеграции данных и оркестрации конвейеров.
— Знание принципов моделирования данных и архитектур хранилищ данных.
— Знание принципов управления данными, управления качеством данных и лучших практик безопасности данных.
— Расположение в часовом поясе CET (+/- 3 часа).
Желательно:
— Знакомство с Azure Synapse Analytics, Data Lake и Azure DevOps.
— Эксперт в разработке Power BI, включая Power Query, DAX и Power BI Service.
— Опыт работы с Python или другими скриптовыми языками для обработки данных.
— Опыт работы с Git или другими системами контроля версий для совместной работы и практик CI/CD.
— Наличие сертификатов Microsoft (Power BI, Azure Data Engineer или SQL Server).
Условия:
— Своевременные ежемесячные выплаты с гибкими вариантами вывода средств.
— Предсказуемые часы работы: стабильные 8-часовые рабочие дни с клиентами.
— До 24 дней гибких выходных в год без потери оплаты для полноценных позиций через Proxify.
— Долгосрочные удалённые позиции в ведущих компаниях.
— Персонально подобранные вакансии без типичных рекрутинговых барьеров.
— Единый процесс заключения контрактов для множества возможностей без дополнительных оценок.
— Постоянная оплата каждый месяц для позиций, полученных через Proxify.
Проект:
Разработка единой системы оценки эффективности.
Задачи:
— Разработка решений вокруг DWH
— Создание ETL / настройка сбора данных, BI-аналитика
— Проработка архитектуры данных и системы для их сбора
— Внедрение нового функционала, сокращение техдолга
Требования:
— Опыт проектирования и построения пайплайнов: Python / Apache Airflow
— Интеграция источников с GraphQL, RESTful
— Хранение данных в Apache Iceberg / проектирование архитектуры хранения данных
— Проектирование архитектуры сбора данных и витрин
— Тестирование данных на всех уровнях требований к качеству данных
— Настройка метрик и алертов Prometheus / интеграция с внутренними системами оповещений
— Знание предметной области
Условия:
Удаленный формат работы
Интересный проект с архитектурными задачами
Профессиональный рост
Digital подразделение крупной производственной компании в поисках Data Engineer (Middle / Senior) в команду, которая строит Корпоративное Хранилище Данных и data-платформы для всего бизнеса.
Основной стек проекта:
Язык программирования Python
Базы данных Greenplum и PostgreSQL
Фреймворк Data Build Tool (DBT)
Фреймворк Spark
Брокер сообщений Kafka
Оркестратор Airflow
Инфраструктура: Kubernetes
Управление инфраструктурой: Terraform, Ansible
Управление кодом: GitLab, SonarQube
Мониторинг: Prometheus, Grafana, AlertManager
Задачи:
— Разработка и поддержка ETL/ELT-процессов в Корпоративное Хранилище Данных
— Организация и оптимизация пайплайнов данных
— Разработка витрин данных и обеспечение качества данных
— Настройка и поддержка инфраструктуры данных (Airflow, Spark, Kafka, DBT)
— Взаимодействие с заказчиками: от сбора требований до внедрения и сопровождения решений
— Документирование и презентация результатов
Требования:
— Опыт работы Data Engineer от 5 лет
— Высшее образование (IT/математика/математическая статистика/физика)
— Отличное знание Python и SQL
— Опыт работы с реляционными БД (Greenplum / PostgreSQL)
— Знание современных технологий обработки больших данных
— Опыт с Airflow, Spark, Kafka, DBT — будет преимуществом
— Умение работать в команде, сильные аналитические навыки и ответственность
Условия:
— Официальное оформление по ТК РФ
— Возможность выбора формата работы (удаленка, гибрид, офис)
— Развитый социальный пакет, ДМС, бонусы