Задачи:
— Архитектура и поддержка масштабируемой и безопасной инфраструктуры данных на Databricks для потоковых и пакетных нагрузок.
— Проектирование, разработка и поддержка конвейеров данных на Python и Spark для автоматизации загрузки и трансформации данных из внутренних систем, внешних провайдеров и блокчейна.
— Проектирование и поддержка размерных моделей данных и слоёв трансформации в dbt с тестами и документацией для обеспечения согласованности метрик.
— Управление озером данных и слоями lakehouse, обеспечение эффективного хранения, разбиения, качества данных, мониторинга и оповещений.
— Интеграция Databricks с различными источниками данных, включая захват изменений из операционных баз, сторонние API и блокчейн, адаптация потоков данных под бизнес-требования.
— Оптимизация конвейеров и хранилищ для производительности, надёжности и экономичности в масштабе.
— Применение лучших практик управления, безопасности и соответствия в облачных и Databricks-средах, включая контроль доступа, шифрование и мониторинг.
— Взаимодействие с инженерами платформы, аналитиками данных и другими заинтересованными сторонами для понимания требований и документирования инфраструктуры, моделей и практик.
Требования:
— Опыт работы Data Engineer не менее 3 лет с ответственностью за производственные конвейеры и архитектуру lakehouse или хранилища данных.
— Практический опыт с Databricks, Delta Lake и Spark для потоковой и пакетной обработки, умение выбирать подходящий режим.
— Глубокое понимание размерного моделирования, медленно меняющихся измерений и проектирования хранилищ данных, умение определять и обосновывать зерно моделей.
— Опыт работы с dbt или аналогичными фреймворками для управления трансформациями, тестированием и трассировкой.
— Знания облачных основ, включая управление идентификацией и доступом, объектное хранилище, сеть и инфраструктуру как код.
— Опыт работы с AWS; опыт Azure или GCP также ценится.
— Уверенное владение Python и SQL для написания производственных трансформаций, сервисов и коннекторов.
— Опыт внедрения практик качества данных, мониторинга и управления в облачных средах.
Желательно:
— Опыт с захватом изменений и репликацией из операционных баз данных.
— Знакомство с блокчейн-данными или on-chain данными.
— Опыт инфраструктуры как кода, предпочтительно Terraform, и CI/CD для данных.
— Опыт работы с BI и семантическими слоями, такими как Holistics, Looker или аналогичными.
— Опыт контейнеризации и оркестрации с Docker и Kubernetes.
Контакты работодателя доступны по кнопке «Откликнуться» после входа.